Anthropic 把 Claude Sonnet 5 正式推上线的同一天,身边做 AI 应用的几个朋友在群里集体发了账单截图。一位做法律咨询工具的朋友,单日 API 调用费从 90 美元飙到 380 美元,核完对话日志发现模型不仅变聪明了,也变啰嗦了。同样的法律问题,Sonnet 4 时代模型输出 380 tokens,Sonnet 5 给到 720 tokens,接近翻倍。
这事最反直觉的地方是 Sonnet 5 的所谓聪明是从更长的推理链里来的。一道普通的合同审查问题,Sonnet 5 内部会做 4 步自反问,我有没有漏掉条款、对方律师会怎么挑刺、上一个结论是否站得住脚、有没有司法解释参考。这些推理最后都体现到输出里,token 消耗普遍增加 40% 到 80%。听起来模型更用心了,但你仔细看输出内容,结论没变多少,中间推理过程变得更详尽而已。
开发者这边真正承压的是 3 类人。第一类是金融、医疗、法律这类专业场景应用,因为 prompt 本身就长,加一倍的输出等于账单直接涨 80%。第二类是做代码生成类产品的公司,Sonnet 5 在写代码时倾向多写注释、多给出可选项,反而把单次任务的 token 数推高。第三类是 RAG 类应用,因为检索召回的文档已经够长,加上模型更爱解释,RAG 整体响应里的 token 涨得最猛。
有一个特别真实的细节。一位做 ToB 客服助手产品的朋友跟我说,他们客户群里一周内有 7 家主动问能不能切回 Sonnet 4,理由直接是账单超了。但切回去之后客户体验评分立刻下滑 12 分,理由是回答变浅了。这事把 Sonnet 5 顶到了一个尴尬位置,想用好它就得做好预算,切回去又撑不起质量。
对做 AI 应用的团队,这事有几个具体动作值得考虑。第一是把 Sonnet 5 当作专家层用,只在客户明确要求深度分析时路由过去,日常问题继续走 Sonnet 4 或者本地小模型,这种分层能省 30% 以上开销。第二是 prompt 端强制约束输出长度,告诉模型不要展开解释,只给结论加关键依据,实测能压回 25%。第三是关注输入侧,做检索时控制召回文档数,别贪多。
这事也让大模型厂商的策略被看得清清楚楚。一年前的策略是模型大就是强,卷上下文、卷参数。现在的策略是推理更有用,但推理贵。Sonnet 5 的定价模型默认假设你会为更长的推理买单,但应用层还没消化这个成本,所以肉眼可见的就是开发者账单上涨。
更往深处看,大模型这门生意接下来几年会变成算力运营加推理优化的游戏。谁能把 token 消耗压下来 30%,谁就能在 B 端价格战里活下来。开源模型这两年走的是这条路,Sonnet 5 这种顶级闭源模型也开始被迫走,后面看 Anthropic 怎么在新一个版本迭代里平衡聪明和账本。
对 ToC 用户这事的直接影响反而不大,普通用户用 Claude 桌面端问答,这种重推理反而让你感觉这 AI 真懂我。真正在交学费的是做 AI 应用的中小团队,他们天天跟 token 账单搏斗。 |