AI Agent 上线前,最容易被低估的是质量门禁。很多团队会看一次演示、跑几条样本、确认没有明显报错,然后就把新版本放进真实流程。问题是,Agent 的风险往往不是单点功能失败,而是权限、成本、知识库、外发和人工接管一起出问题。
质量门禁的作用,就是把“感觉差不多了”改成“这些条件都过了才能放行”。它可以和 评测样本、权限审计、Agent 变更单 连在一起,形成发布前最后一张检查表。
第一道门禁是评测结果
评测不是只看平均分。发布前至少要看成功率、失败边界、客户可见动作、工具调用轨迹和人工接管触发。一个 Agent 如果普通问题答得不错,但遇到资料冲突仍然继续编答案,就不能直接上线。
评测样本也要固定版本。今天跑这一批,明天换另一批,结果就很难比较。更稳的方式是保留核心样本池,每次发布都用同一批任务回放,再单独补充新事故样本。
第二道门禁是权限和动作范围
新版本可能改了工具调用方式,也可能扩大了可读资料和可写字段。质量门禁要确认读、写、外发和删除动作有没有分别授权,敏感动作是否还会进入人工确认。
这一步可以复用 数据边界 的思路。读权限不自动等于写权限,内部草稿不自动等于客户外发。边界说不清,发布就应该先停住。
第三道门禁是成本和延迟
Agent 改得更聪明,也可能更贵。长上下文、重复检索、多模型路由、失败重试,都会把成本和延迟推高。上线前要设清预算阈值和超时阈值,避免版本发布后才发现账单异常。
如果团队已经做过 成本预算 或 运行监控,质量门禁就应该直接引用这些指标,而不是临时估算。
最后一道门禁是退路
没有回滚预案的发布,不应该进入高风险流程。上线前要确认旧版本在哪里、配置怎么恢复、队列怎么暂停、谁能确认恢复、证据导出是否可用。
这和 OpenClaw 回滚演练、暂停队列 是同一件事。能上线,也要能退回,才算具备生产发布能力。
总结
AI Agent 质量门禁不是增加流程负担,而是把发布风险前移。评测结果、权限范围、成本延迟、人工接管和回滚预案都通过,再谈放量上线,团队才不会靠运气运营 Agent。