客服质检这件事,绝大多数团队都卡在同一个地方:人力不够。一个质检员一天认真听完的对话也就几十条,而客服一天的会话量动辄几百上千。结果就是抽检比例低到没有统计意义,问题靠投诉倒推,出事之后再回头翻记录。
用 Agent 做质检的逻辑很直白:让机器把「可疑会话」先挑出来,人只看挑出来的那部分。但真做过一轮的团队会发现,难的不是让模型打分,而是三件事——规则能不能判定、证据能不能回溯、争议能不能复检。这三件事没做好,质检就会变成一场谁都不服的评分游戏。
这篇按落地顺序讲:质检项怎么分、评分怎么设、抽检怎么配、结果怎么用。
第一步:把质检项拆成三类,别混在一张表里评
新手最容易犯的错,是把所有要求塞进一张评分表,结果模型判不准,客服也不服。正确的拆法是按「能不能客观判定」分成三类:
第一类:合规红线。能否客观判定?能。比如是否承诺赔付、是否泄露他人信息、是否辱骂客户、是否绕开流程私自加客户微信。这类要可判定、可复核、零容忍,判错代价很大,所以必须配人工复检。
第二类:服务规范。有没有问候、有没有确认需求、有没有在承诺时限内回复、有没有主动给下一步。这类是「有没有做到」,靠流程节点比对就能判,适合全量自动检查。
第三类:解决效果。问题有没有被解决、有没有重复来电、有没有升级投诉。这类不能靠单条对话判断,必须结合工单状态、后续会话、客户反馈一起看。很多团队把第三类硬塞进单条对话评分,结果分数和真实满意度完全对不上。
记住一条底线:只有能引用到对话原文的要求,才配写进规则库。写不出「扣分依据是哪一句」的规则,最后一定会退化成拍脑袋。
第二步:评分怎么设,才不会变成数字游戏
四条经验:
(1)红线只判「有/无」,不参与加权。红线命中直接判不合格。否则会出现「辱骂扣 20 分、态度好加回来 30 分」这种荒唐结果。
(2)按业务线分别设权重。售前和售后、新客和续费,重点完全不同:售前看响应速度和需求挖掘,售后看一次解决率和情绪安抚。用一张权重表管所有业务线,等于哪条线都不准。
(3)分档,而不是拼小数。A/B/C 三档比 87.3 分有用得多。小数点后一位的精度是假的,档位对应的改进动作才是真的。
(4)单条对话的分数不能直接挂钩处罚。单条判错的概率不低,拿单条分数扣钱会立刻引发对抗情绪,客服会转向「怎么看起来很合规」,而不是「怎么真的解决问题」。单条用于发现问题,周期汇总才用于考核。
第三步:抽检比例怎么配,人力花在哪
推荐「全量初筛 + 分层抽样人工复核」两层结构:
第一层全量初筛跑三类规则,尤其适合第二类服务规范项。这一层成本低、覆盖全,作用是把问题会话标出来。
第二层人工复核按优先级分配,不要平均用力。优先级建议这样排:红线命中必看(100%);低分会话抽看(比如抽 20%);高分会话反抽查(抽 5%,专门验证模型有没有系统性放水);新客服和话术刚改过的时段多看;客户投诉过的会话必看。
最后一点最容易被忽略:抽样必须保留随机性。只复检「模型标记有问题」的会话,你永远不知道模型漏掉了什么。留一部分随机样本,专门用来量质检自身的漏检率。这套抽检逻辑和 人工复核抽检怎么做 是同一套方法,只是把对象从任务结果换成了对话。
第四步:每条扣分都要能点回原文
质检结论只有能被追溯,才有人服。三条硬要求:
(1)每条判罚必须带原文片段和位置——哪一句、第几轮、什么时间。不能只说「态度不佳」,要能精确指出是哪句话。
(2)必须带规则编号和规则版本。同一句话六月不违规、九月违规,是因为规则升级了,不是客服变差了。没有版本号,历史评分就没法比较。
(3)保留完整上下文。只截一句话很容易冤枉人,前因后果要一起留。这套留证要求,本质上是 AI Agent 证据包怎么留 讲过的思路;字段怎么设计,可以直接参考 AI Agent 审计查询字段怎么设计。
第五步:争议怎么处理,别让质检变成单向审判
必须给客服一条申诉通道。而且比申诉本身更重要的是——申诉数据是质检系统最好的体检报告。某条规则申诉率高、且申诉大多成功,说明规则本身写得有问题,要改规则,而不是去教育客服。
具体做法:(1)二次判定由人做,不要让同一套模型重跑一遍。重跑没有意义,只会复现同一个错。(2)申诉成功要回改历史评分。错了不改,下次没人再申诉,通道就废了。(3)定期抽检质检本身。拿一批人工已经判过的会话丢给系统跑,量准确率和漏检率——这就是质检环节自己的 质量门禁。
第六步:结果怎么用,决定这套系统有没有价值
如果质检结果只用来罚款,系统两个月内就会失效——客服的对策永远是「让你挑不出毛病」。真正有效的用法有三个:
一是找话术问题。同一类问题在几十条会话里都丢分,那通常不是客服态度问题,而是话术模板本身有毛病,该改模板。
二是找知识缺口。大量会话卡在同一个问题上,说明知识库没覆盖或者答案过时——正好对着 知识库陈旧内容怎么巡检 去处理。
三是看趋势,不看单点。盯周维度的红线命中率、一次解决率、转人工率变化。特别是转人工率,如果它在涨,往往不是客服变懒了,而是 转人工队列 的判定阈值或知识覆盖出了问题。整套客服体系怎么搭,可以配合 AI Agent 客服怎么搭 一起看。
优缺点说清楚
优点:覆盖从抽检变成全量,问题发现大幅提前;评分口径统一,跨团队可比;留证完整,客户投诉时有据可查;人的精力集中到疑难样本上。
缺点:规则维护是持续成本,业务一变规则就得跟着改;模型对语气、反讽、方言的判断仍不稳定;只盯分数容易把服务做成表面合规;前期需要一批人工标注样本做校准,否则准确率无从保证。
适合人群
适合:客服或销售会话量大(日均两百条以上)、有明确服务规范、有专人在管服务质量的团队。不适合:会话量小到人工能全看的团队;服务标准还没成文的团队——先把规则写出来,比先上工具重要得多。
六个坑
坑一:拿单条分数直接扣钱。立刻引发对抗,数据就失真了。坑二:规则写得判不了。「态度热情」这种要求,机器判不准、人也吵不清。坑三:只复检被标记的会话。漏检率永远量不出来。坑四:规则不版本化。历史评分没法比,趋势全是假的。坑五:没有申诉通道。规则里的错误永远发现不了。坑六:质检和知识库两张皮。会话里暴露的知识缺口没人管,同一个问题会反复丢分。
总结
Agent 做客服质检,一条主线:按可判定性把质检项拆成三类,红线只判有无、规范全量筛、效果看长期;抽检分层配置并保留随机样本;每条判罚都能点回原文和规则版本;申诉结果用来改规则而不是改人。一句心法:质检的目标不是给客服打分,而是让问题在客户投诉之前就被看见。