模型升级对 Agent 团队来说,是一件又想做又怕做的事。想,是因为新模型确实在很多基准上更强;怕,是因为不知道它在真实业务场景里会不会闹脾气——同样的提示词,以前输出的是结构化 JSON,现在突然多了一段解释;以前不调用的工具,现在开始频繁调用。
AI Agent 很适合做模型切换的评估工作。不是替人做决策,而是把新旧两个模型的结果放在一起,按维度拆开让人看。这个流程可以接 OpenClaw 回放对照、知识库陈旧内容巡检 和 变更后验证清单。
样本要覆盖三类任务
模型切换评估的第一件事,是从历史运行记录里选样本。不需要全量,但要覆盖三类:高频任务(占比最大的日常请求)、关键任务(影响金额、权限、合规的任务)、历史故障样本(以前出过问题的 Bad Case)。
抽样时注意去重和脱敏。客户真实数据、员工个人信息、未脱敏的合同条款都不应该直接进入评估样本。可以用 Agent 自动生成与真实场景相似的模拟样本。
对比维度不能只看“对不对”
很多时候新模型的回答也是对的,但“对”的方式不一样。比如旧模型直接给出结论+来源,新模型先解释推理过程再给结论,回复变长了但信息密度下降了。这在客服场景里可能拉低满意度。
评估维度建议包括:工具调用是否正确、引用来源是否准确且未过期、输出格式是否一致、是否产生新的幻觉、是否在不该调用工具时调用了工具、响应时间是否显著变化。这些可以和 质量门禁 的检查项对齐。
退化报告要能落到灰度策略
评估不能停在“新模型表现不错”或“有 XX% 退化”。退化报告要具体到场景:哪些任务类型退化、退化程度、是否影响客户可见输出、是否可以接受。然后根据风险等级建议灰度策略。
如果退化集中在非关键任务,可以先对内灰、团队先用、观察一周再对外。如果关键任务退化,就先不上,等新模型的提示词适配做完再评估一轮。参考 失败升级规则 里的分层处理思路。
总结
用 AI Agent 做模型切换评估,是把“换模型”这件事从拍脑袋升级成有数据支持的决策流程。新旧并排对比、多维拆解、退化报告和灰度建议,让团队在享受新模型好处的同时,不至于被意外退化打乱节奏。