很多 AI Agent 项目验收时,最常见的一句话是“演示能跑”。问题在于,演示能跑和生产可用之间隔着很长一段距离。一次顺利的样例,只能说明它在这组输入下输出了一个看起来不错的结果,不能说明它遇到边界、缺资料、权限不足和用户追问时也可靠。
需求验收标准要和 质量门禁、真实失败样本评测集、审计查询字段 放在一起看。Agent 不是单次生成工具,而是会调用工具、读取资料、影响流程的执行系统,验收也要按执行系统来写。
先写清楚输入边界
验收标准第一步不是写“回答准确”,而是写清楚它接收什么输入。比如客户问题、订单号、会议纪要、知识库链接、表格字段、历史工单,这些输入是否必填,缺失时怎么追问,格式不对时怎么处理。
输入边界不清,后面就会把所有异常都归到模型身上。实际上很多错误来自上游资料不完整、字段命名混乱、上下文被截断,或者用户给的目标本来就不明确。
输出格式要能被下游使用
Agent 的输出不是写给自己看的。销售跟进、客服回复、任务清单、风险提示、审批意见,都有下游使用者。验收时要检查输出是否包含必要字段、是否能被系统接收、是否保留来源链接、是否把不确定项标出来。
如果输出只是一段顺滑文字,下游还要人工重新拆字段,就不能算真正验收通过。可以参考 上线验收 的思路,把评测结果、权限变更和回滚演练一起看。
失败处理要提前验收
很多团队只验成功路径,不验失败路径。可 Agent 进入真实环境以后,失败路径一定会出现:知识库没命中、工具返回 403、外部系统超时、用户意图冲突、低置信度无法判断。
验收标准里要写明这些情况分别怎么处理。能重试的重试,不能自动判断的转人工,涉及客户可见动作的要停下来确认。这和 失败升级规则 是同一套控制逻辑。
证据比语气更重要
Agent 回答得自然,不代表结论可靠。验收时要看它是否引用正确资料,是否把推断和事实分开,是否保留工具返回,是否能解释为什么这么做。
对生产 Agent 来说,能复盘比会润色更重要。遇到争议时,团队需要知道它用了哪条资料、调用了哪个工具、谁批准了敏感动作,而不是只看到一段最终回复。
总结
AI Agent 需求验收标准要从“演示能跑”升级为“边界清楚、输出可用、失败可控、证据可查”。只有这样,团队才不会把一次漂亮演示误判成长期可用的自动化能力。