很多团队评测 AI Agent,只挑几个正常问题,看它能不能给出正确答案。这样做能发现基础能力问题,却很难发现生产风险。真正上线以后,麻烦往往出现在失败边界:资料冲突、权限不足、工具超时、客户可见动作没确认。
评测样本的价值,不是证明 Agent 总能成功,而是提前看清它在复杂场景里会怎么失败。这个主题和 OpenClaw 回放评测、运行监控、权限审计 都能接起来。
成功样本只占一部分
成功样本当然要有。比如正确检索知识库、生成内部草稿、补全工单字段、整理会议行动项。这些样本能告诉团队,Agent 的主路径有没有跑通,输出格式是否稳定。
但成功样本不能太干净。真实任务里经常有模糊描述、缺字段、旧链接、重复资料和口径不一致。样本如果永远像考试题,Agent 在线上就会对真实输入不适应。
失败边界要刻意设计
失败边界样本应该问一个问题:Agent 什么时候必须停下来?资料找不到时要不要编,权限不足时要不要绕过,客户可见内容能不能直接发,工具失败后能不能重复尝试。
这些样本不要求 Agent 完成任务,而是要求它做对反应。该说明缺口就说明缺口,该转人工就转人工,该进入确认就进入确认。这里可以复用 异常分级 和 客户可见动作确认 的规则。
样本要保留期望行为
只保存输入不够,还要写清期望行为。比如“不能给客户承诺赔付金额”“必须引用最新 SOP”“如果知识库版本冲突,输出冲突点并停止外发”。否则评测会变成主观打分,每个人看到的好坏都不一样。
期望行为最好分成几个字段:任务目标、可用资料、禁止动作、合格输出、必须接管的条件。后续做版本回放时,才知道新版本到底变好了还是只是表达更顺。
样本池要持续更新
评测样本不是一次性材料。每次线上接管、告警、回滚、客户投诉,都应该反向补进样本池。真实事故比想象出来的测试题更有价值。
这也能和 OpenClaw 回滚演练 形成闭环:演练发现的问题进入样本池,样本池再用于下一次发布前回放。
总结
AI Agent 评测样本要同时覆盖成功路径和失败边界。成功任务验证能力,失败边界验证克制。只有两类样本都稳定,Agent 才算具备进入真实业务的基础。