过去半年,关于编码 Agent 的讨论大多围绕模型:谁更强、谁更便宜、谁在基准上多考了几分。
但真正每天在跑 Agent 的人会看到另一件事:账单涨得比能力快。一个无人看管的长任务,单次预测会滚成长链推理、几十次工具调用和反复的反馈循环,token 就是这么烧掉的。
行业里降本的主流做法一直停留在模型这一层:更快的注意力核、量化压缩、换成更便宜的小模型。英伟达最近的一篇研究换了个地方下手——不碰模型,去改模型外面那一层。
事实梳理:SoL-Pi 是什么
先说清楚这个系统到底在做什么。
英伟达的研究者把目标定在 harness——也就是模型和运行环境之间的那层控制逻辑。它决定 Agent 怎么看状态、怎么选动作、怎么处理返回结果。Codex、Claude Code、OpenClaw 这些系统里都有这一层,站内 Agent = Model + Harness 那篇讲的正是它的位置。
优化 harness 一直是件难事,因为工具调用、上下文管理、结果验证、中止逻辑之间存在强耦合:在一个环节省下来的 token,可能在另一个环节变成错误,或者只是把成本推到了更后面的阶段。过去的做法是人去读长长的执行轨迹,从里面总结反复出现的失败模式,再翻译成代码改动。
SoL-Pi 做的事,就是把这个循环自动化:
- 一个研究 Agent 去读另一个 Agent 的执行轨迹。
- 提出对 harness 的修改建议。
- 在准备好的环境里实际跑一遍,看改动能不能扛住。
- 只有「保持能力 + 降低 token」的候选才被保留。
论文自己的说法是,这套方法和递归自我改进有关——用一个 AI 去优化另一个 AI 的控制逻辑。
规模与效果数字
- 搜索规模:在 535 个可执行环境里探索了 152 个方向,其中包括 495 个来自 GitHub issue 与 PR 配对的任务,以及 40 个合成测试用例;整个过程产生了 3000 多次运行、6 万多次 Agent 与环境交互。
- token 效果:在 EdgeBench 上,相比 Codex 省下 50% token,相比 Claude Code 省下 54.3%。四种机制全开的组合用少 49% 的 token 拿到 Pi 基线 93.7% 的分数;只挑最强单项机制的版本反而比 Pi 基线高出 5.3% 的分数,同时还省 token。整体降幅区间是 44.7% 到 49%。
- 金额:效率版本把一次测试的消耗从 1339 美元降到 894 美元;作者估算相对原生 Codex 与 Claude Code 每小时省 8.75 到 13.50 美元,相对 Pi 每小时省 4.36 到 5.71 美元。
- 跨模型:整套系统只用 GPT-5.6 Sol 做搜索,之后把调好的 harness 原样用到 Opus 5 上,保住了 Pi 性能的 94.3%,省额大体相当。
它到底改了什么:留下来的四种机制
自动搜索最终保留下来的四种机制,本质上在做同一件事:减少送给模型处理的文本。
- Action Fusion(动作合并):把连续两步合成一步,比如「改代码 + 跑测试」直接合并,省掉一整个模型调用。凡是见过 Agent 改完代码还要停下来「决定要不要跑测试」的人,都能马上明白这里省的是什么。
- Online Context Compact(在线上下文压缩):每个规划步骤之后都检查一次,在不丢关键信息的前提下把累积的上下文削掉一截。这也是站内 上下文管理 那篇里最常被问到的一环。
- ObservationPack(观察打包):把冗长的工具输出归档,后续步骤只放一段短摘要,而不是每次都重发全文。
- Evidence-Preserving Reducer(保证据归约):把体量很大的错误日志和测试日志交给一个更便宜的模型压缩,同时加一道自动校验,防止关键线索在压缩过程中被漏掉。
这四个机制本身都不新鲜。难的是耦合——这也正是它值得作为一篇研究发出来的原因。
影响分析:这件事真正的分量在哪
第一,被优化的对象从「模型」换成了「harness」,这是一条新的优化路径。过去两年降本几乎都在模型层:量化、蒸馏、换小模型、买更便宜的服务。这些做法的共同点是能力往往跟着一起降。SoL-Pi 证明的是另一条路:模型一点不换,光是让控制逻辑别那么啰嗦,成本就能砍掉近一半。对「Agent = Model + Harness」这个框架来说,这是 harness 第一次被当成可自动搜索、可量化的优化目标,而不只是靠人凭经验调。
第二,评测设计比结果数字更值得学。自动优化 harness 有个已知的老毛病:过拟合到搜索时用的任务上,换个不熟的任务就不好使。SoL-Pi 的处理方式是严格隔离——把 EdgeBench 和搜索过程彻底隔开,51 道公开任务里只拿 11 道对最终候选做一次性验证,剩下 40 道留作最终评测,结果绝不回流到搜索里。这个设计比「省了 49%」重要得多,因为它回答了为什么这个数字有可能在别处也成立。
第三,成本口径要拆开看。论文里相对 Codex 和 Claude Code 的每小时省额,其实叠加了两个变化:从原生 harness 换成 Pi,以及在 Pi 之上再做 SoL-Pi 的改动。有分析把它拆过一遍——相对 Pi 的省额大约只占相对原生 harness 省额的 42% 到 50%,剩下那一半属于「换基座」的功劳。这不是质疑结果,而是提醒:引用这类数字时要说清楚基准是什么。这和站内 Agent 成本怎么算 强调的口径问题是一回事。
第四,省 token 的代价被如实写出来了。上下文变短会影响提示缓存的复用;在 Terminal-Bench 4 的 63 个 CPU 任务上,SoL-Pi 解出 15 个,Codex 和 Pi 各解出 18 个,虽然总成本只有 Pi 的四分之一左右;在数学奥林匹克的 Lean 4 任务里,它以最低的「每解出问题成本」拿下了 6 题中的 3 题。这些差异说明:平均省一半,不等于每个任务都省一半;分数上的小幅让步,在有些场景会变成工程师的返工时间。
第五,迁移性仍是开放问题。搜索用的环境有 495/535 来自 GitHub 的 issue 与 PR 配对,任务分布相当集中;换到 Opus 5 之后,论文也承认机制被触发的频率和力度都下降了。作者把「预训练一个通用 harness」列为未来方向,并把递归式的效率提升称作愿景而非当前结论。这个措辞是谨慎且诚实的。
老达点评
第一,这条新闻真正的看点不是「省一半 token」,而是「优化对象换了层」。模型这一层已经被研究得非常透,边际收益越来越薄;harness 这一层长期靠人手工调,几乎没人把它当作一个可以系统搜索的空间。SoL-Pi 的价值在于把这件事从手艺变成了方法——有搜索、有验证、有保留标准。
第二,「让 AI 改 AI」听起来吓人,但这篇论文最扎实的部分恰恰是它防止自我欺骗的那一段。研究可以自动化,评测不能自动化到失去独立性。把基准彻底隔离、把结果和搜索断开,这是让「自我改进」不至于退化成「自我印证」的关键一步。凡是在做 Agent 自优化的团队,这一步都值得抄。
第三,我今天最想提醒的是别急着照搬。这些机制是在特定任务分布和特定模型上搜出来的,论文自己都说了换模型后触发频率会下降。对大多数团队来说,先做一次「harness 体检」比直接套用更有价值:翻一翻自己的执行轨迹,看看 token 到底花在哪——是重复重发的长输出?是改完代码还要单独问一次要不要跑测试?还是日志一股脑全塞进上下文?这几个问题不需要英伟达的论文就能回答,改起来也不用等模型升级。排查思路可以参考 工具调用失败怎么排查 和 AgentOps 可观测性 里的分层做法。
第四,在成本焦虑之外,还有一层更长远的意义。当模型能力趋于同质、价格战打到每任务成本这一层,工程侧的差距会重新变成主要差距。同样是 GPT 或 Opus,harness 做得好和做得差,成本能差近一半、结果能差百分之几。这个空间对团队反而是好消息:你不需要等下一个更强的模型,也不需要换成更便宜的供应商,就能把自己的单位成本压下来。
第五,对国内团队最实际的一条建议:把「省 token」和「省事」分开算。Action Fusion 这类机制本质上是砍掉一次决策,它省的是钱,但可能让 Agent 少了一次检查的机会。什么地方可以合并、什么地方必须保留独立的一步,这个判断只能由你的业务来定,模型替你决定不了。
总结
- 事件:英伟达研究者发布 SoL-Pi,用一个研究 Agent 读取另一个编码 Agent 的执行轨迹、提出 harness 修改建议并实测验证,只保留「保持能力且降低 token」的改动。
- 规模:535 个可执行环境、152 个探索方向、3000 多次运行、6 万多次 Agent 与环境交互。
- 效果:EdgeBench 上相比 Codex 省 50%、相比 Claude Code 省 54.3%;四种机制全开省 49% token、达到 Pi 基线 93.7% 的分数;单次测试成本从 1339 美元降到 894 美元。
- 关键判断一:优化重心从模型层移到 harness 层,是一条「不换模型也能降本近一半」的新路径。
- 关键判断二:严格隔离搜索与评测是这篇论文最值得借鉴的方法论,它回应的是自动优化最典型的过拟合风险。
- 关键判断三:数字要连着基准一起看——相对原生 harness 的省额里,大约一半来自「换基座」而不是 SoL-Pi 的改动;换模型后机制触发频率会下降,迁移性仍是开放问题。
最后一句:当大家还在抢更便宜的模型时,真正被浪费的钱可能一直躺在自己的控制逻辑里。SoL-Pi 没有给出通用答案,但它把这个问题摆到了台面上,还给出了一套可以照着做的验证方法。
来源说明
本文事实依据英伟达(Nvidia)关于 SoL-Pi 的研究论文,以及 The Decoder、AI and Tech News、The Clarity、TokenFeed 与 The Value Engineering 等公开报道的整理。文中涉及的 535 个可执行环境、152 个探索方向、495 个 GitHub issue 与 PR 配对任务、40 个合成用例、3000 多次运行与 6 万多次交互、EdgeBench 上相对 Codex 省 50% 与相对 Claude Code 省 54.3% 的 token、四种机制全开省 49% 且达到 Pi 基线 93.7% 分数、单次测试成本由 1339 美元降至 894 美元、每小时 8.75 至 13.50 美元与 4.36 至 5.71 美元的估算省额、以及迁移到 Opus 5 后保住 94.3% 性能等数字,均出自上述论文与公开报道;基准隔离设计(11 道用于一次性验证、40 道留作最终评测)以及 Terminal-Bench 4、Lean 4 等对照结果同样来自上述来源。关于成本口径的拆分分析(相对 Pi 的省额约占相对原生 harness 省额的 42% 至 50%)引自 The Clarity 的解读。