Agent 运维复盘最怕“当时好像是这样”。告警截图在群里,工具返回在日志里,人工接管在工单里,恢复结论在会议纪要里。等到真正要复盘,所有人都在翻聊天记录。
OpenClaw 证据归档要解决的就是这个问题:把一次异常从发现、处理、回放到验收的证据串成一条链。它可以接在 告警降噪、回放评测 和 恢复验收记录 后面。
归档从告警开始
一次异常进入归档,第一项应该是告警记录:触发时间、队列、任务类型、影响范围、告警规则、重复次数和当前状态。没有这些字段,后面很难判断问题是偶发还是系统性。
告警还要保留合并关系。相同失败如果已经合并,就要知道它代表多少次原始失败;真正阻塞如果被升级,也要看到升级链路和负责人。
原始输入和工具返回要保留
很多 Agent 问题只看最终答案看不出来。原始输入是否含糊,知识库检索到了什么,工具返回是否为空,模型有没有继续编答案,这些都需要证据。
归档时不一定保存所有敏感原文,但至少要保存可脱敏的摘要、来源 ID、工具状态和错误码。这样既能复盘,又不把敏感数据随意扩散。
人工接管要有结论
人工接管不是简单写“已处理”。归档里要看到谁接管、接管原因、采取了什么动作、是否影响客户、是否需要补知识库或改规则。
这一步和 客户可见动作确认 有关。凡是外发、承诺、删除、写入等高风险动作,都应该能从证据链里查到最后确认人。
回放和验收放在同一条链上
异常处理完以后,要把回放结果和恢复验收接进同一条记录。回放通过了哪些样本,失败样本是否减少,恢复观察看了多久,是否还有再次暂停条件,这些都属于同一件事。
如果这些证据分散保存,下一次同类问题出现时,团队还是要重新拼图。证据归档做好以后,复盘、审计和优化都会轻很多。
总结
OpenClaw 证据归档的重点,是把告警、输入、工具返回、人工接管、回放和验收记录串起来。Agent 生产化越深入,越不能靠记忆复盘,而要靠可查的证据链。