湾区开发者怎样在端侧条件下让 LLM 能实时判答案可信?Cactus 15-35
乌鸦小编 发表于:2026-7-23 21:56 复制链接 发表新帖
阅读数:171
上周有个开源项目上了开发者社区首页,名字叫 Cactus Hybrid,底层跑的是 Gemma 4 E2B。这个项目的玩法不复杂,端侧跑一个小模型,每个回答都带一个 confidence score,分数低的路由到云端大模型兜底。项目方公布的数字里有一个细节值得停下来看,他们的端侧模型在大部分 benchmark 上能追平 Gemini 3.1 Flash-Lite,前提是只把一定比例的查询甩给云端,剩下的由端侧自己处理。这个比例不是产品团队拍脑袋写的,是 confidence score 在真实测试集上跑出来之后切出来的工程阈值。

这件事容易被忽略的不是 routing 概念本身,而是这个比例为什么能成立。On-device 路线过去两年的项目基本都死在两个坑里,一件是端侧算力顶不住全量推理,另一件是模型自己不知道自己什么时候答得不对,于是把所有请求都甩去云端,端侧模型等于不存在。Cactus Hybrid 把 confidence score 当成产品差异化的核心来打磨,每一层级都对应一个独立的 routing 决策,而不是把所有判断交给一个统一阈值。这种颗粒度让一个看似粗略的比例区间在工程上跑得通。

端侧 routing 真正的门槛不是模型本身,是 confidence score 的可信度怎么被外部验证。开源模型说自己有 confidence score,下游开发者怎么知道这个 score 真的反映模型对答案的把握程度,而不是训练分布偏移出来的伪校准。行业里能看到的两条路径,一条是在 held-out benchmark 上画 coverage vs accuracy 曲线,看不同 score 阈值下被挑选出来的样本答对了多少,另一条是把 score 跟实际用户反馈挂钩做在线校准。前者适合 on-device 模型的工程化迭代,后者更适合云端大模型的内部使用。端侧项目要走的是这条工程路径,团队要做的工作就是把这个曲线跑出来当成产品文档的一部分。

对独立开发者和中小团队来说,这套思路被低估的地方在成本结构变化。绝大多数 SaaS 产品现在还是把 LLM 当成云端 API 调用,要么走 GPT 系列,要么走 Claude 系列,端侧 routing 几乎没有产品化。原因不是技术上做不到,是大家默认云端调用便宜,没有动力做 routing 优化。但只要端侧小模型能吃掉一部分查询,剩下的云端调用成本立刻塌掉一截,对一个每月调用几千万 token 的产品,这个成本差值不是省一点点,是能让单月利润率从持平扭到正。接下来一年值得跟踪的不是又冒出几家 on-device 模型公司,而是有没有 SaaS 产品愿意把端侧 routing 当成核心差异化功能去优化。

最后还有一件扎心的事,这个模式最大的风险是被云端厂商反向吃掉。云端厂商只要把 routing 做成内置功能,开发者不需要自己写 confidence score 也不需要挑模型,端侧团队就会变成一层冗余。Cactus Compute 这类公司真正要抢的时间窗口是端侧模型还没被云端原生集成之前,把 routing 工具链打磨成熟,让开发者在云端厂商反应过来之前形成依赖。这个比例区间在这种竞争里反而不是关键数字,关键数字是开发者愿不愿意为这套 routing 工具链单独付钱。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落