Google Antigravity 开放 /teamwork:多智能体跑数天自主解题,Eigen 提速 32 倍、TCSBench 71%,Agent 从「思考图」走向「图工程」

Google Antigravity 开放 /teamwork 封面图,包含多智能体编排、五种工作模式、Eigen 提速、TCSBench、图工程等中文关键词

8 月 27 日,Google DeepMind 和 Google Research 的研究团队宣布在 Antigravity 上开放 /teamwork——一套多智能体编排框架,让 Agent 以「小组作战」的方式自主解决计算机科学和数学里的前沿难题,一次任务可以连续跑数小时甚至数天。Antigravity 团队官方的表述很直接:Agent 自主提出方案、对抗式检验方案、再构建更好的方案,人类只负责定目标和做最终验收。

这不是一次普通的「新功能上线」:随 /teamwork 一起公开的实测数据相当硬核——Eigen(知名 C++ 线性代数库)提速 32 倍、TCSBench 得分 71%、还解决了稀疏凸优化领域的多个开放问题。这篇把事件拆开讲:/teamwork 是什么、五种模式怎么工作、实测含金量在哪、对 Agent 行业意味着什么,最后是我的老达点评。

事实梳理:/teamwork 是什么,五种模式怎么分工

/teamwork 是 Antigravity 的多智能体编排层,通过 /teamwork-preview 命令调用,所有付费 Antigravity 套餐可用,目前定位是 research preview(研究预览版)。它的设计目标很明确:解决「单个 Agent 循环搞不定」的问题——太大、太不确定、太开放的任务。

核心机制是四步循环:生成候选方案 → 对抗式压力测试(找漏洞、证伪)→ 把最强部分组合成更好的方案 → 重复。Google 特别强调了这个设计和「松散组织」的多智能体方案的区别:松散的团队会过早认同早期错误、然后在错误想法上自信地继续盖楼;/teamwork 的结构化挑战机制是——在继续构建之前,先主动找出方案里的缺陷。

具体到工作方式,/teamwork 不是固定几个 Agent 的名单,而是按「模式(pattern)」配置:每种模式是一套角色分工和推进节奏的蓝图,运行时由 Gemini 根据任务自动选择合适的模式。当前开放五种模式:

Iterative Coding(迭代编码)——用于不可分解的编程难题;Distributed Coding(分布式编码)——用于可分解的大型软件工程;Long Proof(长证明)——用于开放的数学与科学问题;Self-Verification(自校验)——用于需要严格校验的深度推理;Document Review(文档审查)——用于论文与文档分析。

Google 官方还给了个非常实在的提醒:这套系统 token 消耗很大,对日常任务来说是过度设计(overkill)——「跑数天解题」是给前沿问题用的,不是给「帮我写个脚本」用的。

事实梳理:实测数据到底有多硬

这次公开的成果分三类,含金量逐个看:

第一,直接落地到开源库的性能优化。/teamwork 把性能优化直接提交进了主流 C++ 库——Eigen 提速最高 32 倍,还优化了 ParlayHash。这不是跑分,是真实代码库里的真实改动,被上游维护者接受了。

第二,基准测试成绩。TCSBench(理论计算机科学基准)得分 71%——这个分数放在「Agent 自主做科研」的语境下相当能打,而且是长周期自主工作的结果,不是单轮问答。

第三,开放问题的突破。解决了稀疏凸优化和子空间近似中的多个开放问题,还设计了一个 cycle-level 的 RISC-V CPU 模拟器,能以不到 1% 的平均误差把操作系统启动到 shell——硬件模拟这种高精度、长链条任务,过去被认为远超 Agent 的能力范围。

另外值得注意:/teamwork 的整体思路被 Google 总结为从「Thinking Graphs(思考图)」走向「Graph Engineering(图工程)」——把长时科研任务当作一张动态执行图来管理,而不是死板的提示词工程。这正好呼应了 Graph Engineering 范式 的判断:多智能体的未来不在单点对话,在组织设计。

影响分析一:长时任务工程,终于等来了正面答案

把 /teamwork 放在最近一个月的 Agent 研究脉络里看,它的位置非常清晰:微软和南大 8 月 23 日发布 LoopsBench,实测最强编程 Agent 跑长周期任务完成率只有 25%(LoopsBench 长周期评测)——「长时任务做不好」是整个行业公认的短板。OpenAI 开源 Codex Harness 把执行框架摊开给所有人看(Codex Harness 开源),Google 转身就用 /teamwork 给出了长时任务的工程答案:把「一个 Agent 硬扛几天」变成「一组 Agent 分角色接力」,用对抗式校验兜住质量。

这是「模型决定起点,Harness 决定能走多远」的又一个实证(Agent = Model + Harness):/teamwork 用的还是公开的 Gemini 模型,没有新模型发布,赢在编排和校验机制。长时任务的解法,不在模型参数里,在工程结构里。

影响分析二:「多智能体集体摆烂」的解法,方向被验证了

多智能体协作最大的质疑来自此前的实测:Anthropic 红队发现 45 个 Claude 协作找漏洞很强,80 个一起写代码却集体摆烂(多智能体红队实测);多 Agent 协作避坑 里也总结过:人一多就容易互相附和、错误互相传染。

/teamwork 给出的解法是把「批评」制度化:先让 Agent 提出方案,再专门派 Agent 找茬、证伪,通过对抗式校验把缺陷扼杀在早期,而不是让团队带着错误一路狂奔。这个设计对国内做多 Agent 产品的团队是个重要信号——多 Agent 不是把角色堆齐就行,「谁来质疑」和「谁来干活」一样重要。谁先把质疑机制做成产品,谁就能在协作质量上拉开差距。

影响分析三:Harness 竞争进入「模式复制」阶段

从 DeepSeek Harness 开源、Codex Harness 开源,到今天的 /teamwork 开放五种模式——Agent 执行框架的竞争已经从「框架有没有」进入「模式全不全」的阶段。开源生态可以快速复制框架,但 /teamwork 这种「长时任务编排模式库」是沉淀出来的:什么任务配什么角色、什么节奏、怎么校验,都是实践出来的 Know-how。这类经验资产,比代码本身更难复制。

对开发者来说,好消息是 Antigravity 有免费档(Individual 计划免费),五种模式值得亲手跑一遍找感觉;坏消息是它托管在 Google 云上,数据出境和网络环境对国内用户不友好——国内团队更多是参考它的模式设计,在自己的 Harness 里复刻。

老达点评

第一,这次发布最值得关注的不是「Eigen 提速 32 倍」这个数字,是「Agent 连续跑几天做科研」这件事本身跑通了。过去一个月行业还在争论「Agent 能不能跑长任务」,Google 直接交了一份「跑给你看」的答卷——TCSBench 71%、开放问题、RISC-V 模拟器,都是实打实的成果。长时任务从「研究课题」变成了「工程能力」,这个转折比任何单点数字都重要。

第二,「对抗式校验」是 /teamwork 最值钱的设计,也是国内团队最容易抄走的东西。很多团队做多 Agent 只做「分工」不做「对抗」——任务拆下去、结果合上来,中间没有质疑环节。Google 用实测告诉你:没有质疑机制的多智能体,就是一群互相点头的人。把「找茬」做成制度化角色,这个思路值得所有做 Agent 的团队抄作业。

第三,泼盆冷水:/teamwork 的成果里有很强的「实验室滤镜」——跑数天、烧大量 token、解决开放问题,这是谷歌级别的算力和工程师配置,普通团队别直接对标。更现实的做法是:把它的编排思想(模式化分工 + 对抗式校验 + 人工验收)搬到自己能承受的任务规模上,先解决「跑 10 分钟不出错」,再想「跑 10 天出成果」。方向对了,步子别迈太大。

总结

8 月 27 日,Google DeepMind 在 Antigravity 开放 /teamwork 多智能体编排框架:五种工作模式(迭代编码、分布式编码、长证明、自校验、文档审查),核心机制是「提出方案 → 对抗式证伪 → 组合改进」循环,Agent 可连续运行数小时到数天,人类只做目标设定和最终验收。实测 Eigen 提速 32 倍、TCSBench 71%、解决稀疏凸优化开放问题、设计出误差不到 1% 的 RISC-V 模拟器。老达点评:这是长时任务工程久等的正面答案,把「多智能体如何不摆烂」的解法从「分工」升级到「分工 + 对抗」;它同时验证了 Agent 行业从「思考图」走向「图工程」的大方向——长时任务的能力,藏在工程结构里,不在模型参数里。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *