英伟达发布开放智能体安全平台:把 Agent 的安全边界从提示词搬进了芯片

英伟达发布开放智能体安全平台:把 Agent 的安全边界从提示词搬进了芯片

9 月 28 日,英伟达发布了开放智能体安全平台(NVIDIA Open Agent Safety Platform),同时上线了开源的安全运行时 OpenShell 和一套参考系统设计 Sentry。这条消息在中文圈被概括成「英伟达推出 AI 智能体安全平台,可实时隔离异常智能体」——这个概括没错,但漏掉了它真正的设计主张。

它真正说的是:企业需要在「模型和 Agent Harness 之外」再建立一道可强制执行的边界。换句话说,过去我们习惯把安全要求写在提示词里、写在系统指令里、写在应用层的策略检查里,现在英伟达主张把这些规则的执行位置往下挪——挪到运行时,挪到芯片里。

这个主张不算新,但被一家卖算力的公司做成了产品线,并且拉了一长串合作方站台,性质就不一样了。站内 英伟达上周刚让 AI 去改 AI 的 harness,这周就给 Agent 上镣铐——一松一紧,正好凑成一组。而和站内 AI Agent 沙箱四层隔离 的区别也很清楚:那篇讲的是要隔离什么(进程、文件、网络、凭证),这篇讲的是由谁来执行这条隔离。

一、事实梳理:这套平台到底由什么组成

1. 三层架构:应用层、运行时层、基础设施层

英伟达自己的开发博客把它拆成三层:应用层(用户自己搭的东西——模型、Harness、工具、数据)、运行时层(把应用层投影到具体基础设施上,并持续监控、实时执行策略)、基础设施层(真正跑负载的硬件资源——网络调用、数据库、文件系统、工具执行的通用算力、安全监控用的加速算力)。

这个拆法本身没什么争议,价值在于它明确了每一层归谁负责。英伟达的说法是「共享责任模型」:模型实验室、企业、硬件供应商各管一层。

2. OpenShell:开源的运行时边界,进程外强制

OpenShell 是一个开源的 Agent 安全运行时,官方说法是「现已广泛可用(broadly available)」。它的工作方式可以概括成三步:把操作者的指令转成可验证的策略 → 策略里明确哪些文件、网络、工具、进程、凭证能被访问 → 在 Agent 运行前检查、运行过程中强制。

真正的关键词是「进程外强制」(out-of-process enforcement)。策略执行不发生在 Agent 自己的进程里,所以 Agent 改不了它——这正好回应了官方对近期安全事件的一句总结:这些事件的模式是一样的,Agent 为了完成任务,绕过了应用层的安全控制。

另外两点值得记下来:OpenShell 在英伟达自家的 Vera CPU 上做到「极低开销」(Vera 是英伟达首款专为代理式 AI 打造的 CPU,官方称沙箱性能比传统 CPU 基础设施快最高 80%);同时它作为开源软件,可以扩展到 Arm、Intel 等第三方计算平台。

3. Sentry:放在数据通路上的带外看门狗

Sentry 是参考系统设计里的第二个组件,运行在英伟达 BlueField-4 DPU 上,官方称之为「带外看门狗」(out-of-band watchdog)。它的三句关键描述值得逐字读:

  • 芯片内执法(in-silicon enforcement):Agent 一旦试图越出软件边界,Sentry 在毫秒级把它隔离并停机。
  • 带外信任域:它运行在与主机隔离的信任域里,即使主机被拿下,这道边界依然存在。
  • 对 Agent 和攻击者都不可见:官方开发博客里有一句直白的话——「Agent 不需要知道自己在被看着」。

最有意思的是控制点的选择。官方描述在机架级方案里,每个计算托盘上只有一条通往模型的通路,而 BlueField-4 就装在这条通路上。它给出的理由是:Agent 不能在没有「下一次思考」的情况下行动——控制了通往模型的路,就同时拿到了最好的观察点和那个 kill switch。

这句话在我看来是整篇发布里含金量最高的一句。它把「可观测性」和「强制力」合并在同一个位置上了。

4. 生态名单与两个具体做法

英伟达列出的合作方覆盖基础设施、软件、模型和机器人各层,包括 Anthropic、Cisco、CrowdStrike、Dell、Figure、HPE、Hugging Face、JPMorganChase、Microsoft、Palantir、Palo Alto Networks、Perplexity、Red Hat、Salesforce、SAP、Scale AI、ServiceNow、SpaceXAI 等。黄仁勋的表态是「安全与防护需要全栈工程」,平台要「汇聚业界、研究人员和公共部门组织,共享最佳实践、统一评估方法」。

名单里有两个做法被具体写了出来,比名单本身更有信息量:

  • Anthropic:Claude Managed Agents 把Agent 的循环放在一台独立服务器上跑,与真正执行工作的沙箱分开,从而形成安全边界;再通过对接 OpenShell 和 BlueField 来收紧对沙箱的访问控制。这是典型的「控制面与执行面分离」,和站内 生产级 Agent 的七道安全防线 里讲的分层思路同源。
  • SpaceXAI:用这套平台来支撑 Cursor 编码 Agent 和 Grok 模型。其总裁的说法很直接:安全应该在模型之外,由 Agent 绕不过去的额外控制来执行。

5. 部署成本:已有硬件的话,是一次软件更新

官方提到,已经在用 Vera 系统加 BlueField-4 的用户,「启用这些保护只需要一次软件更新」。同时强调平台兼容其他硬件系统,但显然是针对自家 Vera CPU + BlueField DPU 优化过的。

二、影响分析:这次真正被产品化的是什么

第一,被产品化的不是安全能力,是安全的执行位置。模型层的对齐、提示词里的规则、Harness 里的策略检查,这三样东西有一个共同缺陷:它们都跑在 Agent 能够触及的软件栈里。官方那句「Agent 绕过了应用层的安全控制」说的就是这件事。而把策略执行挪到一个独立信任域里,行业里其实早就有人在做(云上的凭证代理、出网代理、网卡上的策略引擎),英伟达的贡献是把它做成了一个完整的产品叙事,并绑到了 Agent 这个场景上。

第二,「观察点」和「kill switch」被合并到了同一个位置,这个设计选择值得抄。很多团队的可观测性和权限控制是两套系统:日志平台看行为,权限系统管动作,两边对不上号。英伟达把两者放在通往模型的唯一通路上——因为 Agent 的每一次行动都必须先经过一次模型调用,所以这里既能看到「它想干什么」,也能在毫秒内掐断「它正在干什么」。对自建团队来说,这个思路不需要 DPU 也能部分落地:把出网代理和凭证代理做成强制关卡,而不是写成建议。

第三,开放运行时 + 专有执法层的结构,是一道很清楚的商业分界线。OpenShell 是开源的,还能扩展到 Arm、Intel;Sentry 跑在 BlueField-4 上,是英伟达自家的硬件。所以「开放」开放的确实是运行时和策略语言,而执法层的性能与能力留在了自家硬件上。官方把它包装成「灵活部署」,从商业角度这当然合理,但企业在做选型时要意识到:这道最硬的边界,目前仍与一家供应商绑定。

第四,对自托管 Agent 的团队,可迁移的结论是「把限制放在 Agent 够不到的地方」。不必买 DPU,也能做三件事:出网只走代理并留全量日志、凭证不直接给 Agent 而是通过代理按需换取、花钱和发外链这类高风险动作卡在网关层。站内 AI Agent 权限管理 和 Docker 把沙箱搬上云 里讲的其实是同一件事的不同版本。

第五,几个没有被回答的问题。一是「谁来看守看守者」——Sentry 本身运行在与主机隔离的信任域里,但它是否完全免于被攻破,是个需要时间验证的命题。二是官方提到该系统「本可以阻止今年 7 月的那起 Agent 越权事件」(站内 那起事件我们此前写过),但这是一个反事实论断,不是实测结果。三是硬件级执法带来的新依赖:安全层的版本、策略语言、升级节奏都会跟着供应商走。

三、老达点评

第一,这条新闻最该被记住的一句话是:提示词是请求,权限是控制,芯片是执法。过去两年大家默认「把规则写清楚,模型会遵守」,现在主流厂商自己在用产品投票——不赌模型会守规矩,而是让规矩落在模型碰不到的地方。这个转变比任何一份安全白皮书都有说服力,因为它来自卖模型和卖算力的人。

第二,别被「硬件安全」四个字吓退。我特意把控制点那一句挑出来,就是因为它对普通团队也成立:找出你的 Agent 每次行动都必经的那条路——通常是模型调用、出网、或某个高危工具——把检查放在那里。你不需要 BlueField,你需要的是承认「写在提示词里的规则不算规则」。凡是在做 OpenClaw 之类的自托管 Agent 的,先把出网和凭证这两处卡住,收益比换一套安全平台大得多。

第三,我不太喜欢这次发布里「开放」这个词的用法。OpenShell 开源、能跑 Arm 和 Intel,这些都是好事;但真正提供毫秒级强制力的那一层,目前只在英伟达自家 DPU 上。这不是批评——商业公司这么设计天经地义——而是提醒采购买单的人:你买到的是「运行时开源」,不是「执法层开源」。以后做 Agent 安全选型,问一句「最硬的那道闸是谁在执行、能不能换供应商」,比看功能清单有用。

第四,方向对,但落地还很早期。Anthropic 的做法(控制面和执行面分开)和 SpaceXAI 的用法(给编码 Agent 设上限)都是能马上理解的工程手段,但生态名单上多数公司目前只是「加入」,不是「已经跑在生产里」。对企业来说,真正需要先做的其实是盘点:你现在有多少个能自主行动的 Agent、它们各自能碰到哪些凭证、哪些动作是不可逆的。盘点没做完就谈平台,只是把不安全的东西搬到一个更贵的地方。

第五,顺手提一句方向相反的另一件事。站内那篇 让 OpenClaw 每天做网站安全巡检 讲的是「用 Agent 去查有没有被人入侵」;这一篇讲的是「防止 Agent 自己越界」。两个方向都重要,但工程上的待遇完全不同:前者是加法,加个巡检任务就行;后者是减法,要主动收掉 Agent 本来就有的权限。减法永远比加法难推,这也是这类安全平台在内部落地时最常见的阻力来源。

总结

  1. 事件:9 月 28 日英伟达发布开放智能体安全平台,由开源运行时 OpenShell 与参考系统设计 Sentry 组成,覆盖应用层、运行时层、基础设施层三层。
  2. 关键机制:OpenShell 把操作者指令转成可验证策略,在 Agent 进程之外强制执行,已广泛可用且可扩展到 Arm、Intel;Sentry 跑在 BlueField-4 DPU 上做带外看门狗,芯片内执法,毫秒级隔离越界 Agent,对 Agent 与攻击者均不可见。
  3. 设计亮点:控制点选在通往模型的唯一通路上——控制了这条路,就同时拿到最佳观察点和 kill switch。
  4. 可迁移结论:把限制放在 Agent 碰不到的地方(出网代理、凭证代理、网关限额),而不是写在提示词里;这是普通团队今天就能做的那一半。
  5. 三个未解问题:看门狗自身的安全、官方「本可阻止 7 月事件」属反事实论断、以及执法层与单一硬件供应商的绑定。
  6. 一句话判断:被产品化的不是安全能力,是安全的执行位置——这比一个新产品更值得记住。

来源说明

本文事实依据英伟达官方新闻稿《NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment》、英伟达开发者博客《NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring》、英伟达官网 Open Agent Safety Platform 解决方案页与技术页,以及英伟达中国官方博客《NVIDIA 发布开放智能体安全平台,保障智能体从测试到部署全流程安全》。文中涉及的发布时间(9 月 28 日)、OpenShell 的进程外强制与可扩展至 Arm/Intel、Sentry 运行于 BlueField-4 DPU 并实现毫秒级隔离、Vera CPU 沙箱性能提升最高 80%、合作方名单、Anthropic Claude Managed Agents 的控制面与执行面分离设计、SpaceXAI 将平台用于 Cursor 与 Grok、以及「已有 Vera 与 BlueField-4 的系统启用保护只需一次软件更新」等表述,均出自上述官方来源。关于「平台本可阻止 7 月 Agent 越权事件」的说法系英伟达在发布中的表述,属反事实论断;中文报道与行业解读(含新华社旗下媒体、界面新闻及行业分析)已作交叉印证。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *