2026 年过半,AI Agent 的最大变化不是模型更强了,而是跑在生产环境里的 Agent 越来越多了——而且大多数还没有正经的可观测性和治理机制。SyncSoft 的调查数据显示,已部署 Agent 的团队中超过一半没有安全监督和结构化日志;Snyk 的报告则发现企业安全团队平均只能看到约三分之一的 AI 资产。
这不是 Agent 能力问题,是 Agent 运维问题。就像十年前微服务取代单体应用时,大家很快发现”能跑”不等于”能管”。Agent 正在经历同样的阶段,而解决这个问题的答案叫 AgentOps——一套覆盖行为审计、链路追踪、策略控制和运营可见性的治理栈。它和 证据包、质量门禁 属于同一套体系。
第一层:行为日志与身份归属
最基础的治理层,也是最容易被忽视的一层。很多 Agent 团队只在模型层面打日志(用了什么 prompt、消耗多少 token),却不去记录 Agent 到底做了什么:它读了哪张数据库表、写了哪条 CRM 记录、给哪个客户发了什么消息、当时是谁的权限在驱动这次操作。
生产级 Agent 日志至少应该包含:每次工具调用的参数和返回值、调用时用的身份和权限上下文、操作对象(数据记录 ID、API endpoint、文件路径)、调用结果(成功/失败/权限拒绝),以及前后相关的 Agent 状态快照。
一个常被忽略的细节:Agent 通常以”服务账号”身份运行,但实际触发的权限是所属用户的。如果日志里只记录”Agent X 更新了 CRM 记录 Y”而不记录”是谁让 Agent 去更新这条记录”,出了事根本找不到责任人。这和 审计查询字段 的思路一致——身份不是挂在 Agent 身上,而是要穿透到触发源。
更重要的是,行为日志不止是排查问题的工具。一旦 Agent 触及合规场景(EU AI Act Article 12 要求高风险 AI 系统自动生成日志并保留 6 个月),它就变成法律义务。StackOne 的分析说得很直白:监管审计不看你用了哪个模型,看的是 Agent 做了什么。
第二层:全链路 Trace 与回放
单条日志能告诉你 Agent 做了一件事,Trace 能告诉你这件事是怎么来的。一个典型的 Agent 错误链:用户说”帮我查一下上周的订单”,Agent 调了日期解析工具拿到日期范围,调了数据库查询工具拿到订单列表,然后调了邮件工具把结果发给了另一个人——每一步的输入输出都正确,唯独第二步把”上周”当成了”上个月”。如果你只看日志最后一步”订单列表已发送”,你不会知道这条链路从中间就错了。
全链路 Trace 要做的是把一次 Agent 执行的所有步骤串起来:prompt 版本 → LLM 推理 → 工具调用 → 工具返回 → 后续推理 → 最终输出。每一步带上时间戳、token 消耗、决策依据。这不仅方便排查,更重要的是能做回放——把同样的 prompt 和工具环境代入同一条 Trace,看 Agent 是否做出和上次一致的决策。
这和 回放对照 是同一个东西的工程化版本。回放对照的场景偏向治理审计,Trace 的场景偏向日常排障和持续优化。两者底层数据可以共享。
第三层:政策门禁与权限控制
Trace 告诉你发生了什么,政策门禁决定什么不该发生。政策门禁是 AgentOps 里最”不性感”但最关键的一层。它不是 prompt 里写的”请不要做 X”,而是代码层面的硬检查:
一是数据门禁。Agent 不能读取包含 PII(个人身份信息)的记录,不能向外部系统传输内部数据库内容,不能把员工数据混入训练集。这些检查不是靠 LLM 判断,而是靠规则引擎在工具调用前后做拦截。
二是动作门禁。涉及金额的操作必须走人工审批,涉及生产环境变更必须有变更单号,涉及客户外发必须经过内容审核。这和 失败升级规则 中”关键动作不能只靠 Agent 自己判断”的原则一致。
三是速率门禁。单个 Agent 在单位时间内只能调用有限次数的外部 API、只能发出有限数量的消息、只能消耗有限额度的 token。这是一道防”疯跑”的保险丝。ICMD 的分析指出,把 Agent 当特权集成来管理——而不是当聊天 UI 来管理——是安全团队必须建立的心智模型。
这层最难落地的地方不是技术实现,而是业务决策。什么算”涉及金额”?多少金额需要审批?哪些数据算 PII?这些定义不是工程师能拍板的,需要和法务、合规、业务三条线对齐。
第四层:成本与质量运营仪表板
前三层管的是”能不能”,第四层管的是”值不值”。进入生产后,Agent 不是免费跑的——token 消耗、API 调用、人力审核都是成本。如果没有仪表板,一个 Agent 疯狂调用工具一个月花掉几千美元,你可能到下月账单才看到。
运营仪表板应该至少包括:各 Agent 的调用量、成功率和失败率趋势,工具调用频次分布和异常 spike,token 消耗和成本分摊,人工干预率(需要转人工的比例)、审批通过率和审批耗时。这些数据不仅能做成本优化,还能反过来驱动 Agent 质量改进——比如某个 Agent 的失败率每周都在涨,说明要么模型退化、要么数据源变了、要么对手动配置有了依赖。
一些团队已经开始把 Agent 运维指标嵌入现有的 Datadog / Grafana 面板,而不是另起一套。思路和 SRE 一样:Agent 就是生产服务,只是它的行为不如传统服务那么确定。
总结
AgentOps 不是一套工具,是一套方法论。日志告诉你 Agent 做过什么,Trace 告诉你为什么这么做,政策门禁告诉你什么不能做,仪表板告诉你做得好不好。四层配齐之前,Agent 不是不能跑,只是不建议让它碰真正重要的数据和操作。Agent 工程的拐点,就是从”能不能让 Agent 做事”变成”能不能让 Agent 做事后还敢负责”。