OpenAI 把 Agent 循环做成托管服务:Agents API 公测,上下文压缩、子 Agent 与沙箱全包

OpenAI Agents API 公测解读资讯封面图,包含托管 harness、会话持久化、上下文压缩、子 Agent 编排、沙箱伙伴、仅美国驻留等中文关键词

9 月 10 日,OpenAI 把 Agents API 放进公测。一句话概括这件事的分量:过去你必须自己写的那套 Agent 循环,现在可以按 token 向 OpenAI 租用。会话怎么存、上下文满了怎么压、任务失败怎么恢复、子 Agent 怎么并发——这些原本属于「工程功底」的部分,被官方收进了一个托管服务里。

同期 OpenAI 还上线了 GPT-Live-1 语音 API(全双工、可打电话)和 ChatGPT Work 里的 Data agent。三件事放在一起看,方向非常清楚:OpenAI 在从「卖模型」转向「卖运行模型的那套系统」。下面先把事实梳理清楚,再谈三层影响。

事实梳理:这次到底发布了什么

它是什么。Agents API 是 OpenAI 把 Codex 使用的编排 harness 开放成托管 API。官方的表述是:它负责会话编排、上下文压缩和失败恢复,你的应用负责提供工具和选择执行环境。换句话说,循环本身归 OpenAI 管,循环外面的事归你管

四个概念。整套东西被拆成四个对象,记熟这四个就能读懂文档:Agent(模型、指令、工具、MCP 服务器)、Environment(代码和文件在哪里跑,可以没有、可以 OpenAI 托管、可以自托管)、Session(一个长期存活的 Agent 实例,跨轮次保存状态)、Events 与 items(实时事件流与可回查的消息、工具调用记录)。和过去那套「会话是 Postgres 里一张表、环境是你自己照看的容器、事件是没人看的日志文件」相比,这是一次彻底的产品化。

托管了哪些能力。会话持久化(跨多轮存活)、上下文自动压缩(接近窗口上限时自动把前面的内容压掉,保留继续工作所需的信息)、失败恢复与状态保留(可从暂停处接着跑)、子 Agent 编排(可设置并发上限,官方示例是 3-4 个)、tool search(工具定义按需加载,减少 token 占用)、programmatic tool calling(让模型用代码并行、串联和过滤工具调用结果,只把有用部分回填上下文)。

运行环境有三条路。OpenAI 托管沙箱、你自己的基础设施(含 VPC)、或第三方沙箱伙伴——首发集成了九家:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle Cloud、Runloop、Vercel,分别覆盖纯托管和 VPC 部署、不同 CPU/GPU/内存/冷启动/成本档位。另外原生支持 MCP 服务器连接,还带了一个安全 MCP 隧道能力。

计费方式。没有额外平台费。模型按所选模型的 API 价格计费(文档示例用的是 GPT-6 Astra),OpenAI 自带工具按标准价,托管沙箱按标准容器价格计。官方还给了现成模板:研究、客服、DevOps、会议、数据分析五类,说明控制台里已经预设了常见场景。

两个硬限制。公测版数据驻留仅限美国,且不支持零数据保留(ZDR);文档还专门补了一句——选择自托管沙箱并不能让 Agents API 变成 ZDR 可用。因为会话状态本身是持久化设计(这是它的核心卖点),数据存在哪由服务决定,不由沙箱位置决定。默认的滥用监控日志保留 30 天,应用状态保留至删除。

同期两件事。GPT-Live-1 进入 API:一个能同时听和说的全双工语音模型,把语音从「转文字—推理—转语音」三段式压成一个模型,电话场景可用,语音层每分钟 0.05 美元、按秒计费,后端模型和工具另算。官方评测里它搭配 GPT-6 Astra 在 Tau3 端到端语音任务上排到第一,首次尝试完成率 83.6%(对比上一代语音模型 45.7%),轮次切换延迟降到 0.8 秒左右;语言学习平台 Speak 反馈学习者被误打断的次数减少了约八成。同时 ChatGPT Work 上了 Data agent,可接 Redshift、BigQuery、Snowflake、Databricks、MongoDB、Datadog、Google Drive、SharePoint 等企业数据源,用自然语言问数并生成看板。

影响一:Agent 的「运行系统」被单独拿出来卖了

这次发布最值得琢磨的不是功能,而是卖的东西变了。过去两年大家买的是模型能力(分数、上下文长度、价格),现在 OpenAI 把「模型外面那一圈」——会话、压缩、恢复、编排、沙箱——打包成商品。它的定价很直白:harness 不收钱,收模型和算力的钱。这个结构对小团队特别有吸引力,因为「自己实现一遍这些」的工程成本,往往比省下的那点效率更贵。

但要注意它和站里报道过的 OpenAI 开源 Codex Harness 是两条腿走路:一边开源 SDK 让你在本地跑循环,一边把 harness 做成托管服务按量收钱。开发者实际上被给了两个入口——想自己控就自己控,图省事就交出去。这个组合很聪明,但也意味着「中间态」最难受:既不想全托出去、又不想从零自研的团队,得想清楚自己到底要买哪一半。

影响二:对国内团队来说,「用不了」本身就是一条重要信息

这次发布里对国内读者最有价值的一条,是那两个限制:数据驻留仅美国 + 不支持零留存。这不是技术细节,而是选型的分水岭——凡是碰客户数据、医疗、金融、政企业务的场景,这一条基本就把托管沙箱挡在门外了。

更值得注意的是官方那句补充说明:自托管沙箱也不豁免。这句话戳破了很多人的惯性想法——「我用自己的容器,数据就在自己手里了」。实际上只要会话状态由服务方持久保存,沙箱在哪都改变不了数据流向。这也是为什么站里反复强调 AI Agent 权限管理密钥与数据边界 要自己拿住:能力可以外包,边界不能外包。

对国内开发者来说,理性的结论不是「用不了真可惜」,而是把自建 harness 的价值再确认一遍。站里写 长时任务设计上下文管理任务规划范式 这几篇时讲的都是同一件事:这套能力自己搭一遍确实累,但搭完之后,数据、权限、成本、审计全在你手上。托管方案省下的是时间,付出的可能是议价权。

影响三:托管不等于「不用管」

最后一个容易被误解的点:OpenAI 托管了 session、compaction、recovery,但业务层的治理一点都没少。会话可以长期存活,意味着任务可能在无人看管的情况下跑几天;子 Agent 能并发,意味着并行调用会放大成本;工具调用能并行,意味着出错时的现场更复杂。这些都是托管服务不替你负责的部分。

换句话说,Agent 成本控制失败升级规则上线质量门禁 这些功课,在托管方案下依然要做,甚至更重要——因为循环跑在别人的机器上,你对「它现在在干什么」的感知反而更弱了。已有的监控和审计链路(参考 审计查询字段设计)要跟着一起适配。

老达点评

第一,这次真正被商品化的,是「Agent 的运行系统」,不是模型能力。模型分数的竞争已经进入边际递减阶段,接下来拼的是工程完成度:会话怎么持久、上下文怎么压、失败怎么恢复、并发怎么控。OpenAI 把这些收进 API 并且不收平台费,等于用定价告诉市场——「请把工程预算花在业务上,别花在造循环上」。这对整个行业是好事,因为它会把大量重复造轮子的投入释放出来。但反过来也意味着,中间层框架的生存空间会被挤压,只有做深某一类场景或某一类合规要求的才有活路。

第二,数据驻留是这次发布里最该被记住的一句话。功能表再漂亮,合规表过不去就是零分。「仅美国驻留 + 不支持零留存 + 自托管沙箱也不豁免」,这三条连在一起,把相当一部分企业场景直接排除了。我给的建议很实在:选型时先看合规表,再看功能表。什么时候这三条放松了,什么时候才是真正的「开箱可用」。

第三,给国内团队一句话:能力可以租,边界必须自己拿。托管 harness 省掉的是重复劳动,省不掉的是责任——数据在哪、权限多大、花了多少钱、谁批的,这些永远是你的活儿。所以我更愿意把这次发布理解成一次「标准确认」:它确认了会话、压缩、恢复、编排就是 Agent 的四大基础设施能力。至于这四样是自己搭还是租,取决于你的数据敏感度和合规要求——但至少要清楚地知道自己租出去的是什么。

总结

9 月 10 日,OpenAI 把 Codex 的编排 harness 开放为公测 API:Agent、环境、会话、事件四个概念,会话持久化、上下文自动压缩、失败恢复、子 Agent 编排、tool search 全部托管;沙箱可选 OpenAI 托管、自托管或九家伙伴;不收平台费,按模型 token、工具和容器标准价计费。同期 GPT-Live-1 语音 API 上线,Data agent 进 ChatGPT Work。老达点评:Agent 的运行系统正在被商品化,竞争的焦点从模型分数转向工程完成度;数据驻留仅美国、不支持零留存这两条限制,决定了它短期内只能是「部分人的好工具」;对国内团队而言,能力可以租,数据、权限与成本的边界必须自己拿。真正的护城河,从来是你自己那套 harness。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *