Uber 披露 70% 代码 PR 由 AI Agent 参与:3600 个 Agent 技能、日均执行 3 万次,用量涨 9.4 倍 AI 账单却稳住了

Uber 软件工厂 AI Agent 成本报告封面图,包含 70% PR、3600 技能、日均 3 万次执行、成本降 34% 等中文关键词

8 月 29 日,Uber 工程团队在 AI Engineer 2026 大会上发布了一篇长文《Running a Software Factory Efficiently at Uber Scale》,把自家 AI Agent 的使用数据摊开了:超过 70% 的代码 Pull Request 由本地或云端 AI Agent 参与生成,工程师自建了 3600 多个 Agent 技能,每天执行超过 3 万次。从 2 月到 8 月,公司周活跃用户涨了 7 倍、Agent 请求量涨了 9.4 倍——但 AI 总账单,自 4 月起基本持平。

用量涨了近 10 倍,钱没跟着涨。这违背了很多人对 AI 的直觉认知,也几乎是目前最接近「生产级 Agent 成本手册」的公开材料。这篇拆开讲:Uber 的数据意味着什么、它是怎么做到的、对企业有什么启示。最后是我的老达点评。

事实梳理一:数字本身,Uber 把 Agent 用到了什么程度

先看硬数据:

70% 的 PR 由 Agent 参与。注意表述是「attributed to local or cloud agents」——参与生成,不是完全无人干预。工程师的角色从「写代码」变成「给 Agent 下任务 + 审核产出」。

3600+ Agent 技能,日均执行 3 万次。技能覆盖代码评审、CI 故障自愈、端到端 PR 生成(带视觉校验)、值班告警分级、线上 bug 定位、代码维护清理——大量会话已不是人发起的,而是托管 Agent 自动发起的。

2 月至 8 月:周活涨 7 倍、请求量涨 9.4 倍、总账单稳定。按常理,用量涨 10 倍账单至少翻几倍,Uber 没有。固定模型对照(把模型锁死、排除升级变量)后:每千次请求成本较峰值降 34%,单会话成本较 6 月峰值降 52%。

事实梳理二:怎么做到的——一张六项成本公式

Uber 的核心方法论,是把 AI 总成本拆成六个相乘的因子:

总支出 = 用户数 × 每用户会话数 × 每会话轮次 × 每轮请求数 × 每请求 Token 数 × 每 Token 单价

前两项是「采纳与参与度」——Uber 希望它们继续涨;最后一项是「模型选型」——由供应商定价决定,Uber 做的是给不同负载匹配不同模型(子 Agent 走轻量模型,主模型负责任务拆解)。真正的战场在中间三项:每会话轮次、每轮请求数、每请求 Token 数——Uber 管它们叫「Agent 自己为自己干的活」:浪费的轮次、冗余的子 Agent 调用、膨胀的上下文。把 AI 成本从一个模糊的总数,拆成六个可以独立度量、独立优化的工程指标,是这篇长文最值钱的地方。

这跟我们之前讲过的 AI Agent 成本控制 一脉相承:省钱的关键不是换便宜模型,而是消灭无价值的 Token。

事实梳理三:具体手段,每一刀都砍在 Token 上

Uber 的优化手段值得逐个记下来,都是可复制的:

子 Agent 路由到便宜模型。子 Agent 干的是边界清晰的搬砖活,不需要顶级推理——默认走轻量模型,主模型只做拆解和校验。随着编排能力提升、子 Agent 调用越来越多,这一招的杠杆越来越大。这就是 AI Agent 怎么选模型 讲的「任务类型决定模型档位」在超大规模下的实践版。

上下文硬上限 400K。哪怕模型支持 1M 窗口,Uber 也把自动压缩卡在 400K Token——超过就压缩,避免上下文无限膨胀。推理强度默认 Medium,砍掉按倍率计费的推理 Token。

提示词缓存按经济学调参。缓存读取只要输入价的 0.1 倍,但写入有溢价(Anthropic 5 分钟 TTL 写 1.25 倍、1 小时写 2 倍)。工程师的交互式会话经常空闲超过 5 分钟,用 5 分钟 TTL 会频繁失效重写——切到 1 小时 TTL;短命的子 Agent 轮次间隔很短,保持 5 分钟 TTL。一个缓存 TTL 都要分两种场景算账,这就是成本纪律。

MCP 网关 + CLI 按需调用。原生 MCP 会在会话初始化时把所有工具 Schema 塞进上下文——100 个工具就是凭空多 5-7 万 Token,每轮还重复携带。Uber 把所有 MCP 流量收进统一网关,模型只输出 Shell 命令,由 CLI 按需解析调用,工具按需检索,Schema 不再常驻。

Code-Mode 批量执行。把轮询、等待这类循环逻辑放到模型外的子进程里跑,模型只输出脚本、接收最终结果摘要。实测 SQL 场景 Token 省 50%-100%,批量任务省超 90%。

事实梳理四:度量升级——从「每 Token 多少钱」到「每合并 PR 多少钱」

Uber 把 AI 指标从「每百万 Token 成本」升级成了「结果导向」:每个合并 PR 多少钱、每次代码评审多少钱、每次告警处理多少钱——配合回滚率、F1、MTTR 这些质量信号一起看。他们的 uReview 自动代码审查系统在数千条真实 PR 上评测:切换模型后 F1 提升的同时,单次评审成本反而下降。

这个转变值得所有团队抄作业:只盯 Token 价格,等于只盯汽油价格不盯油耗——AI Agent 评测怎么做 里强调的「指标要对着业务结果」,Uber 给了最完整的范本。

影响分析一:70% 的含义——Agent 从「协助」到「委托」的拐点

70% 这个数字的真正含义,不是「AI 写了七成代码」,而是 Uber 工程师的工作模式已经变了:从 2025 年的 Copilot 模式(AI 补全、人采纳),变成 2026 年的 Agent 模式(人下任务、Agent 执行、人审核)。据此前报道,Uber 内部约 84% 的 AI 使用者已进入 Agent 模式——不到三个月,行为模式完成迁移。

工程师从「写代码的人」变成「管理 Agent 产出的人」,Agent 和 RPA 的区别 里说的「RPA 做手脚、Agent 做大脑」在这里具象化了:Agent 干的活越多,人的价值越往「判断、审核、兜底」上移。

影响分析二:成本纪律,恰恰是当前行业最缺的

一个值得警惕的信号:Uber 的竞争对手们正在推相反的方向——更大的上下文窗口、更高的推理强度、更强的自主性。而 Uber 证明,成本纪律来自约束这些默认值:400K 上限、中等推理、轻量子 Agent、按需工具。在 F1 持平的前提下把活路由给更弱的模型,才是可持续的规模化方式。

还有一层背景:Uber CTO 今年 4 月曾承认公司已用完 2026 年的 AI 预算。这篇长文本质上是「预算压力倒逼出的工程方法论」——不是有钱才谈纪律,恰恰是没钱了才必须算清账。对所有正在超预算的企业,这张六项公式就是一张可操作的拆解路线图。

影响分析三:写代码变便宜了,审代码成了新瓶颈

70% 的 PR 由 Agent 参与,意味着人工评审的工作量不是变小,而是被推到了更关键的位置——大量 Agent 写的代码,质量把关全压在审核环节。这和我们之前写过的 Claude 388 个 PR 只有 180 个合并 是同一个信号:写代码的成本断崖式下降,审代码、验质量、控回归的成本反而成了瓶颈。

Uber 的解法是用 Agent 审 Agent:uReview 自动评审 + 人工抽检复核。这套「Model + Harness」的组合拳——模型负责生产,工程系统负责质量门禁——才是 70% 数字能安全落地的原因。没有质量门禁的 70%,是灾难;有质量门禁的 70%,才是规模化的开始。

老达点评

第一,Uber 这篇长文是 2026 年至今最值钱的企业级 Agent 落地材料,不是因为它数据好看,而是因为它把「AI 成本」从一个财务问题拆成了一个工程问题。六个因子、五个度量层级、结果导向的指标——这套东西任何团队都能抄,不需要 Uber 的规模。抄作业的第一行:把「这个月 AI 花了多少钱」改成「每个合并 PR 花了多少钱」。

第二,「用量涨 9.4 倍、账单持平」听起来像魔法,拆开全是笨功夫:缓存 TTL 分场景调、子 Agent 用便宜模型、MCP 工具按需加载、上下文设硬上限。没有一个是玄学,全是可执行的工程决策。这印证了一个判断:Agent 规模化的瓶颈从来不是模型能力,是成本纪律和工程化程度。谁先学会「算着账用 AI」,谁就能在别人被账单压垮时继续扩张。

第三,70% 这个数字对普通团队没有直接参考价值,别焦虑。Uber 有几千个工程师、巨型单体代码库、专职平台团队,它的 70% 是「平台能力 + 工程纪律」的结果,不是「买个好工具」的结果。中小团队该学的是方法论(六项公式、结果度量、审核门禁),不是抄数字。先把一个高频场景跑通、把账算清,再谈规模化。

第四,审代码成为新瓶颈这件事,值得所有想用 Agent 写代码的团队警惕。Agent 生产效率越高,质量门禁越不能省——证据包、回放、人工抽检这些治理动作,是「70% PR」能安全存在的必要条件。Uber 让 Agent 审 Agent,但保留人工复核;对大多数团队,先做到「Agent 写、人审、留痕」,再逐步放开。

总结

8 月 29 日 Uber 工程博客披露软件工厂数据:超 70% 的代码 PR 由 AI Agent 参与生成、3600+ 个 Agent 技能、日均执行超 3 万次;2 月至 8 月周活用户涨 7 倍、Agent 请求量涨 9.4 倍,AI 总账单却自 4 月基本持平,固定模型对照下每千次请求成本降 34%、单会话成本降 52%。秘诀是把成本拆成六项公式逐项优化:子 Agent 走轻量模型、上下文 400K 硬上限、缓存 TTL 分场景、MCP 网关按需调用、Code-Mode 批量执行,并把度量从「每 Token 成本」升级为「每合并 PR 成本」。老达点评:这是迄今最接近生产级 Agent 成本手册的公开材料——用量涨十倍而账单持平,靠的不是降价是纪律;对普通团队,方法论比数字更有价值,而「写代码变便宜、审代码变贵」的新瓶颈,决定了质量门禁必须跟上。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *