美西时间 9 月 22 日,Anthropic 和 OpenAI 相隔约 90 分钟各发布了一款更便宜的模型。Anthropic 推出 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna。两家都在降价,这个不稀奇;稀奇的是它俩不约而同地把宣传口径换掉了——从「每百万 Token 多少钱」换成了「完成一个任务多少钱」。
对做 Agent 的人来说,这个口径变化比降价本身重要得多。
事实梳理:这一天到底发了什么
Anthropic 这边:Claude Opus 5.5
- 是 Claude 5.5 系列的首款模型,官方称在大多数任务上与自家更强的 Fable 5.1 相当。
- 定价每百万输入 4 美元、每百万输出 20 美元,单价较上一代 Opus 5 的 5 美元 / 25 美元下调约 20%。
- 但官方强调典型工作负载的成本降幅约 40%——因为新模型完成同一个任务消耗的 Token 更少。输出速度比 Opus 5 快 30% 以上。
- 缓存读取从每百万 0.50 美元降到 0.20 美元,降幅 60%。Anthropic 明确说缓存读取在编码和 Agent 类负载的成本里占大头。
- 官方给的一个例子很直观:把 HAProxy 负载均衡器从 C 重写成 Rust,Opus 5.5 用 9.5 小时完成,比 Fable 5.1 便宜 51%。
- 安全侧:官方称越界尝试次数比 Opus 5 减少约 85%,且该模型经 METR、Frontier Design 等外部机构在发布前测试。Sonnet 5.5 与 Haiku 5.5 将在未来几周推出。
OpenAI 这边:GPT-6 Sol 与 GPT-6 Luna
- 是 9 月初发布的 GPT-6 Astra 之下的两个低价档。Sol 面向复杂工作和编码,Luna 面向大批量、目标明确的任务(摘要、抽取、短问答)。
- Sol 每百万输入 2 美元、输出 10 美元(原 4 / 20);Luna 每百万输入 0.10 美元、输出 0.50 美元(原 0.20 / 1.20)。官方称是永久标价而非限时促销。
- 两者上下文窗口 105 万 Token,支持从 none 到 max 的推理强度设置,通过 Responses API 支持联网搜索、文件检索、代码执行、计算机操作和 MCP 连接。
- 缓存命中按未缓存价格的 10% 计费(即 90% 折扣)。
同一天还有一条容易被漏掉的消息:月之暗面推出 Kimi Code 桌面版,把原先的命令行工具升级成图形界面。
真正的新东西:计价单位从「每 Token」换成了「每任务」
OpenAI 这次的公告里,大部分对比用的都不是跑分和单价,而是完成一个任务花多少钱。几个能说明问题的数字:
- 在覆盖 47 个工具的 AutomationBench 上,Sol 最高推理档得分 33.2%,每任务 0.27 美元;同榜对比的某个旗舰模型最高档得分 26.9%,每任务成本是它的十倍以上。
- 在面向长周期专业任务的 Agents’ Last Exam 上,Sol 最高档 56.4%,官方称同榜对比模型成本低 60%。
- 在真实代码库的软件工程测试 DeepSWE v1.1 上,Sol 最高档 68.8%,距对比模型的 69.9% 差 1.1 个百分点,但每任务成本低约 80%。
Anthropic 用的也是同一套话术:在 CursorBench 4.0 上,Opus 5.5 默认设置得 52.5%,而对比模型的最好成绩是 41.7%,官方称单任务成本约为其三分之一。
为什么这个口径变化值得单独说?因为它承认了一件以前大家心照不宣的事:Token 单价和实际花费之间,隔着「要花多少 Token 才办成事」这一层。一个模型单价便宜,但如果它啰嗦、要反复试、答错了要重来,最后总账可能更贵。反过来,单价贵一点但一问就对、一次跑通,总成本反而低。Agent 场景把这件事放大了——一次任务可能包含几十上百轮调用,任何一轮的浪费都会被累积。
所以从今天起,「换个便宜的模型能省多少钱」这个问题,答案不再是拿两个单价相除,而是拿每任务成本相比。站内 成本怎么算、怎么省 里那套「Token 单价不是唯一变量」的框架,正好被这次发布从厂商侧证实了一遍。
比降价更实用的一条:缓存终于变成可调的东西
如果只能从这次发布里挑一条立刻能用上的改动,我会挑缓存。OpenAI 把提示缓存从「黑盒优化」做成了三道可操作的开关:
- 显式缓存断点。开发者可以自己指定哪一段提示前缀该被复用,而不是等系统去猜。
- 改推理强度和工具开关时不再打破缓存。这条对 Agent 的意义最大:以前任务进行到一半想「这一步简单,降低推理强度省点钱」,或者「这一步不需要那些工具了,关掉几个」,很可能导致前面缓存好的上下文全部失效、整段重算。现在可以调整而不丢缓存。
- 缓存预热。对确定会重复使用的部分(系统指令、工具定义、参考资料)提前预热,让响应更快开始。
配套还给了缓存诊断:一个看板加诊断接口,能看到有多少输入命中缓存、随时间怎么变化,并且会主动标出「本可以命中但没命中」的地方。官方举的例子是诊断结果会直接告诉你这次未命中是因为工具列表变了——这种信息以前基本只能靠猜。
效果方面,OpenAI 引用的数据来自 GitHub:在数十亿次请求上,需要重新处理的提示词 Token 占比下降了超过一半。这个数字跨了最近几个月,也就是说它不只作用于新模型。
关于缓存的原理、三类缓存各自适合什么场景,站内 缓存怎么用 那篇已经讲过基础,这里只补一个这次的增量判断:缓存正在从「省钱的技巧」变成「Agent 架构的一部分」。以前它是调优项,现在不规划缓存边界的 Agent 是在持续交冤枉钱——尤其是长任务,轮数一多,重复处理同一段前缀的开销会线性放大。长任务该怎么设计检查点和状态恢复,长时任务怎么设计 里可以对照着看。
短板也得说:这不是全面升级
官方对比之外,第三方评测给出的图景更复杂,有几条值得记下来:
- 知识工作类任务出现退步。Artificial Analysis 的统计里,Sol 在两个知识工作类评测上的表现低于上一代,且这次 Sol 在某个通用能力指数上的准确率从 59% 降到 54%,同时「愿意作答的比例」从 99% 降到 83%。也就是说,一部分「提升」来自说得更少、更保守。
- Luna 在编码 Agent 指数上是下降的(从 43 到 41),而 Sol 是上升(55 到 57)。低价档并不自动等于进步。
- 答案变短带来的副作用。有评测机构把知识工作类失败归因于「答案更短,漏掉了引用、细节或计算过程」。在按清单打分(rubric)的场景里,这直接扣分。
- 官方也自己标注了对比的局限:竞品分数取自公开报告而非自跑,部分用替代模型結果填充,且某条对比因忽略回退成本而低估了实际花费。
把这些和降价放在一起看,结论其实挺冷静:这轮动作的主轴是成本,不是能力。能力上是个渐进的小幅变化,成本上是个明确的台阶。评测怎么做 里讲过「评测结果是用来做决策的,不是用来排名的」——这次正好是个例子:同一个模型,按成本看是大利好,按知识工作能力看是退步,选不选它完全取决于你跑的是什么任务。
老达点评
三句话。
第一,价格战的真正推手不是安全承诺,是开放权重模型。两家在 90 分钟内接连砍价,说明定价权已经不完全握在它们手里了。有便宜的开源权重模型在下面顶着,闭源厂商的定价空间就是有天花板的。对我们这些用模型的人来说,这是好事——但对「把预算规划建立在某家 API 单价上」的做法,这是个警告:单价会变,别把成本结构建在一个会快速变动的数字上。
第二,缓存那三条改动,实际影响比降价大。降价是被动受益,缓存是可主动优化的。尤其是「改推理强度和工具开关不破缓存」这一条,它让「按步骤难度动态调整成本」这种以前想都不敢想的策略变得可行——难的步骤上高推理强度,简单的步骤降下来,而不用付出整段重算的代价。如果你在跑长任务 Agent,这一条值得这周就去试。
第三,别被「便宜了一半」冲昏头。降价公告里的对比数字,全都建立在「任务一次跑对」这个前提上。真实场景里,任务失败要重跑、输出不对要返工,这些成本不会因为你用了便宜模型而消失,有时反而因为质量下降而增加。所以正确的算法是:先用一小批真实任务回放,测出「每成功完成一个任务要花多少钱」,再决定换不换。这个动作站内 模型版本管理 里那套「切换模型先跑回放验证」的流程可以直接复用;至于省下来的钱值不值得换来一点质量损失,只有你自己的任务集能回答。
另外补一个容易忽略的对照:这不是今年第一次降价。站内 DeepSeek V4.1-Flash 发布 那篇里算过一笔账——API 降价的同时,自部署的综合成本反而可能上升。买 API 还是自建,这道题不会因为这次降价就有了统一答案,只会更需要按自己的负载特征算一遍。
总结
把这一天的信息压成四条:
- 两家同天降价,口径都换成了「每任务成本」。以后算账别只比 Token 单价。
- 缓存从黑盒变成可调。显式断点、改推理强度和工具不破缓存、缓存预热、缓存诊断——这四条对长任务 Agent 的省钱效果可能超过降价本身。
- 能力是渐进变化,成本是明确台阶。第三方评测显示知识工作类任务有退步,低价档不自动等于进步。
- 「便宜一半」要用自己的任务集验证。测每成功任务成本,而不是看单价。
最后留一句:模型会继续降价,这个趋势不会停。与其反复追最新最便宜的那一款,不如把「能测量、能回放、能回滚」这套能力建起来。当换模型变成一个低风险动作时,供应商的每一次降价,你才真的收得到。