OpenClaw 进入日常运行以后,不可能每一条任务都人工复核。全量复核会拖慢效率,也会让团队重新回到手工处理。但完全不看也不现实,因为 Agent 的错误往往先出现在少数高风险样本里。
人工复核抽检要和 质量门禁、运行指标仪表盘、转人工队列 配合使用。它的目标不是制造审批压力,而是用有限人力守住质量底线。
先定义必须复核的样本
不是所有样本都靠随机抽。涉及客户可见回复、外发通知、权限变更、金额和合同、公开发布、重要客户、低置信度结论和失败恢复的任务,应该优先进入复核池。
这类样本如果只按普通任务放行,出了问题影响会更大。规则写清以后,OpenClaw 可以自动把它们打上复核标签,交给负责人确认。
随机样本负责发现盲区
必须复核解决的是已知风险,随机抽检解决的是未知盲区。比如某个低频流程开始出现回答偏差,某类知识库引用逐渐过期,或者某个工具返回格式变化了,随机样本更容易提前暴露问题。
随机比例不用一开始就很高。可以按任务量、风险等级和历史问题调整,重点是持续做,而不是临时想起来才看几条。
复核字段要固定
人工复核不能只写“通过”或“不通过”。至少要记录任务类型、输入摘要、Agent 输出、引用证据、工具轨迹、风险标签、复核结论、修改原因和后续动作。
这些字段可以直接复用 审计查询字段。字段固定以后,复核记录才能被统计,团队也能知道问题来自知识库、提示词、权限还是工具。
抽检结果要回到规则里
如果同类问题连续出现,不能只靠复核人每次改一遍。要把结论回写到知识库、提示词、工具校验、质量门禁或转人工规则里。否则抽检就会变成长期人工补丁。
复核的意义,是让系统越来越少犯同类错误。抽检发现问题,规则吸收问题,指标观察变化,这才是闭环。
总结
OpenClaw 人工复核抽检的关键,是把必须复核和随机抽检分开设计。不是每条都看,但高风险、低置信度、客户可见和失败恢复样本不能漏。这样既保留自动化效率,也能给质量留住最后一道检查。