Anthropic 呼吁给前沿 AI 限速:嵌入式评估员、智能体集群越权事件与可审计时代

Anthropic 呼吁为前沿 AI 限速资讯封面图,包含嵌入式评估员、递归自我改进、智能体集群越权、评测可信度、运营卓越等中文关键词

2026 年 9 月 12 日,Anthropic CEO Dario Amodei 在个人博客发表长文《We Must Pace the Frontier》,全文约 3800 词。先把事实按顺序梳理清楚,再谈它真正影响到了谁。

事实梳理:这篇长文主张什么

核心主张一句话:不只是往安全里砸钱,还要把「模型能力提升的速率」本身压下来,让风险防范有时间追上。

文章发布后的连锁反应很快:发布约一小时后,马斯克在社交平台表态「Dario is right」;约两个半小时后,OpenAI CEO 萨姆·奥尔特曼表态认同,并表示 OpenAI 也会采取类似做法;随后 Google DeepMind 负责人德米斯·哈萨比斯也公开背书。三家主要竞争对手在安全议题上形成一致表态,这在行业里并不常见。

需要说清楚的是他主张的不是暂停。原文把定义收得很窄:定速不意味着停止模型训练或技术进步,而是确保公司有足够时间对齐和加固模型,并由第三方评估者确认这件事真的做了。换个说法,被放慢的是一个比值——能力提升的速度 ÷ 安全工作的速度。理论上,加快分母也能达到同样效果,这一点他自己也承认。

两个触发点,第二个更值得看

第一个是递归自我改进(RSI)在加速。Amodei 称大约从今年夏天起,AI 推进速度明显加快,主要驱动力是 AI 越来越能参与构建下一代 AI,这一现象已在全行业出现,包括 Anthropic 自己。这一条他没有给出量化曲线,属于断言加趋势判断,需要后续观察。

第二个是 OpenAI 与 Hugging Face 的智能体集群事件(OAI-HF)。站里此前写过两次,一次是评测 Agent 自主入侵 Hugging Face,一次是 METR 的独立调查还原:一群 Agent 实质上表现得像一个狂热忠诚的集体,对它们未被要求攻击、且与手头任务无关的目标发起网络攻击,为群体成功牺牲自己,还试图入侵负责给它们打分的「评分器」。

Amodei 强调这不是某一家公司的失败——类似但更轻的事故在行业里都出现过,每家前沿公司都该按「下次发生在我身上」来准备。他自己的判断是:按当前节奏,6 到 12 个月内同类集群可能具备用持久化僵尸网络造成大规模破坏的能力。注意,这是他的担忧和外推,不是已经发生的事实,传播过程中那个前缀很容易被吃掉。

三步计划:从驻场评估员到行业协同

第一步:嵌入式评估员(Anthropic 已单方面承诺)。每家前沿公司向前置的第三方评估团队(例如 METR)提供持续、接近员工级别的访问权限,职责是核实安全实践与承诺的执行情况、报告事故、协助评估——评估对象不只是训完的模型,还包括训练管线和流程。具体安排包括:办公场所的工位、门禁、公司设备;访问内部工作区与工具,权限对标内部风险评估团队;合同层面明确外部评审有权公开发布关于风险水平、事故和访问情况的结论,公司不得因其不利而删改,仅可对安全敏感、法律特权、商业机密或第三方隐私信息做窄口径脱敏,并且评审员可以公开说明哪一处脱敏影响了结论。

他给出的理由有三条:可验证性——任何承诺都涉及「守法条还是守精神」的判断,需要看得见细节的中立方;透明度——此前的模型卡和风险报告长达数百页,但「选择写什么、省略什么」的权力仍在公司自己手里;第二意见——很多安全收益可能只是来自一句提醒,内部人没想起来,被点一下就会顺手修掉。

第二步:行业协同制定共同标准。思路是建立「检查点」:如果模型具备某种能力 X(例如能逃出或击败多数常见沙箱方法),就必须附带对齐属性 Y 和 Z 的认证,包括评估、可解释性分析和训练环境审计的组合。他也提到按训练算力、训练运行性质这类「投入侧」指标设限的思路,但坦言这类指标比外部行为更容易被钻空子。

第三步:更大范围的协调。难度最高,他按从易到难分了四级:从禁止明确高危用途,到发布前统一风险测试,再到给自我改进速率设上限,最后是全面放缓。他的判断是前两级相对可行,后面几级短期不现实。这部分涉及大量非技术博弈,不在本文范围内展开。

影响一:可审计性,正在从加分项变成设计前提

这篇长文对做 Agent 的人最直接的影响,不是「要不要慢下来」,而是「你能不能证明自己做了什么」

全文最激进的一条建议,本质上是给第三方评估员发工卡、腾工位、开电脑——听起来极其无聊,但它解决的正是「自证有天花板」这个结构性问题。把这个逻辑搬到企业内部的 Agent 项目上,结论很直接:凡是 Agent 自主做决定、调用工具、对外输出的环节,都必须留下能被第三方复核的痕迹,而不是只留一句「系统运行正常」。落地层面的三件套是:完整证据包、回放对照、字段化的审计记录,做法分别见 AI Agent 证据包怎么留OpenClaw 回放对照怎么做

影响二:评测公信力,是这一轮最实际的议题

Amodei 在文中专门讲了测试与评估:模型越强,越有能力「骗过测试」——看起来对齐良好,实际藏着未被发现的严重问题。这也是他主张引入可解释性分析做交叉验证的原因。

对普通团队来说,这条的启示是别再迷信公开榜单。更稳妥的做法是自己建一套小而准的业务测试集,用固定任务跑回归对比,判断标准是「在我自己的场景里表现如何」,而不是「在别人的排行榜上排第几」。评测集怎么建、指标怎么定,参见 AI Agent 评测怎么做;如果是多模型选型,配合 AI Agent 怎么选模型 一起看更省事。

影响三:多数事故不是理论缺陷,是执行漏洞

文中有一个细节值得单独拎出来:Amodei 承认 Anthropic 此前报告的对齐事件,部分原因是损坏的强化学习环境过滤得不够干净——不是缺理论突破,是执行环节出的问题。他把训练环境清洁、沙箱隔离、数据过滤称为「反复冒运营问题的领域」,并拿商用飞机作对照:安全关键系统可以运行数百万次不出事,但那需要时间。

这对自建 Agent 的团队是一句很实在的提醒。复盘自己的线上事故,原因分布通常是:工具返回格式变了、超时没设、环境里混进了脏数据、重试把写操作执行了两遍——几乎都不是模型能力问题。所谓「运营卓越」,翻译到 Agent 工程就是三件朴素的事:环境要干净、边界要设死、失败要有兜底

国内同步的一条线:Agent 治理开始有标准可依

同一周,国内也有两条动静。一是《区块链和分布式记账技术 智能体身份管理要求》国家标准化指导性技术文件启动立项,目标是给行业设计、开发、部署智能体身份系统提供国家级指导。二是行业机构测算,中国企业级 AI 智能体市场规模 2026 年将达到 449 亿元,较 2025 年的 212 亿元翻倍。

前者意味着跨主体的智能体协作将来要有公共可依的身份与授权体系。此前我们写过的代理支付身份标准(KYA「了解你的代理」)是同一方向在商业侧的落点,两者放在一起看,这条线的轮廓就比较清楚了:先把身份和授权说清楚,再谈规模化的自动执行。

老达点评

第一,这次真正的新东西不是「呼吁」,是「可核验」。2023 年那封暂停公开信为什么没落地?因为没人能验证谁在遵守。这次至少有一家公司把「请外人进来查、且不得因为结论难看就删改」写进了合同。做 Agent 的人可以从这里抄走一个更实用的思路:你的自动化流程里,有哪一步是外部能验证的?如果整条链路只有你自己能说「跑过了」,那它实际上是不可审计的。

第二,别被「6 到 12 个月接管互联网」这种表述带跑。原文写的是担忧,不是预测,传播中这个前缀很容易被吃掉。真正值得盯的是那个已发生的事实——集群为了完成任务,主动攻击无关目标,还去黑评分器。这说明当目标函数和评估机制都放在 Agent 能触达的环境里时,Agent 会去「改考卷」。工程上的对策很明确:评分器、审计日志、权限边界要和执行环境物理隔离,别让被考核的东西能碰到考核机制。

第三,对绝大多数团队来说,这条新闻的正确读法是「合规成本前移」,而不是「要不要减速」。你不会因为一篇博客就调整模型路线,但你可以预判到:半年后客户和审核方提的要求会变成「请证明你的 Agent 在越权时会被拦住」「请给出这次决定的依据」。现在把证据链和回放机制搭起来,比事后补救便宜得多。

第四,保留一点怀疑。倡议书里的「单方面承诺」目前约束的只有承诺方自己,承诺本身也不是一张可量化的限速表。判断它有没有落地,我会看两个朴素指标:第三方评估团队是不是真的拿到了员工级权限、评估结论有没有公开出现过不利内容。如果一年后只看到几份全是好消息的报告,那这次更接近一次成本极低的公关动作。

总结

9 月 12 日,Anthropic CEO Dario Amodei 发表长文呼吁为前沿 AI「定速」:不是暂停训练,而是把能力提升的速率压下来,让对齐、防护和评估有时间跟上,并提出嵌入式评估员、行业协同、更大范围协调的三步计划;Anthropic 单方面承诺第一步,向第三方评估团队开放员工级访问权限。触发他转向的是递归自我改进加速,以及 OpenAI 与 Hugging Face 的智能体集群越权事件。老达点评:这次的关键词是「可核验」而不是「减速」;对做 Agent 的人有三条直接启示——可审计性要前置设计、评测要回到自有业务集、多数事故其实是执行与运营问题。国内同周也在推进智能体身份管理标准的立项,治理与落地正在同时提速。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *