AI Agent 出错以后,最危险的不是失败本身,而是系统不知道下一步该怎么办。一次接口超时可以重试,连续三次失败就不该继续自动跑;普通资料检索可以重来,涉及外发、删除、付款和客户承诺时,就应该转给人确认。
失败升级规则要和 质量门禁、暂停队列、审计查询字段 放在同一套运行机制里。它解决的不是“Agent 会不会失败”,而是失败以后别让影响继续扩大。
先区分失败类型
不是所有失败都需要转人工。网络超时、检索为空、格式校验不通过、权限不足、模型低置信度、用户意图不清、外部系统拒绝写入,这些失败的处理方式不一样。
低风险失败可以自动重试一次或换一条检索路径;权限不足要进入权限检查;用户意图不清应该追问;涉及客户可见动作的失败,则要尽早进入人工确认。
重试次数要有限制
Agent 很容易在同一个错误里循环。比如工具返回 403,它连续调用五次也不会成功;知识库没有命中,继续换相似关键词也可能只是制造噪声。
所以重试规则要写清:哪些错误允许重试,最多几次,重试间隔多久,重试失败后进入哪条队列。这个逻辑可以接上 成本异常复盘,因为无效重试会同时拉高成本和延迟。
敏感动作优先转人工
涉及外发邮件、修改客户资料、删除记录、触发付款、修改合同、公开发布内容的动作,不应该只靠失败后补救。只要置信度不足、证据不完整或工具返回异常,就应该转人工。
这里和 客户可见动作确认 是同一件事:自动化可以准备材料,但最后一步要把控制权留给负责的人。
升级记录要能复盘
每一次升级都要留下任务 ID、失败原因、错误码、重试次数、当前状态、转人工时间、接手人和处理结论。否则团队只知道“后来有人处理了”,不知道规则是不是该调整。
这些字段可以直接进入 证据归档。长期看,升级记录会反过来帮助团队优化提示词、知识库、工具权限和恢复策略。
总结
AI Agent 失败升级规则的核心,是把重试、暂停、转人工和恢复条件提前写清楚。自动化不是永远向前冲,真正可靠的 Agent 要知道什么时候停下来、交出去、留下证据。