用 AI Agent 做数据标注:标注规范、预标注、一致性校验到质检抽检的完整流程

用 AI Agent 做数据标注:标注规范、预标注、一致性校验与质检抽检

接一个分类任务、做一份评测集、训一个小模型——这些事到最后都会卡在同一个地方:没有人标数据,或者标出来的数据互相之间对不上。数据标注听着是整条链里最没技术含量的活,实际上它决定了一大堆下游工作的上限。

现在很多团队的做法是「让模型先标,人再改」。方向没错,但执行起来常出三种问题:模型标错的被当成标准答案一路往下传、两个人标同一批数据有三成不一样、抽检只看随机样本,结果夹缝样本全部漏掉。

先把这篇在站内的位置说明白:用 AI Agent 做合成数据 讲的是「数据从哪来」;数据质量门禁 讲的是「已经进库的数据怎么按规则把脏的拦住」;评测样本怎么建 和 评测怎么做 讲的是「怎么用数据判断一个 Agent 好不好用」。这一篇补的是最前面那一段:监督信号本身是怎么产生的,以及怎么保证它靠谱。

一、标注真正难的地方不是「标」,是「一致」

先说一个容易被忽略的事实:标注的成本大头不在第一次标,而在返工和仲裁。一次标错可以改,两个人标准不一样就得开会。所以做标注的正确顺序不是「赶紧标起来」,而是先把争议解决掉。

有两个信号可以判断你的标注流程是不是出了问题:

  • 同一条数据,隔一周让同一个人再标一次,结果不一样——说明标签定义本身有歧义,不是人记性差。
  • 两个人标的样本,分歧高度集中在少数几个标签上——说明这几个标签的边界没写清楚,也不是标注的人不认真。

换句话说,标注质量的问题,绝大多数最后都要回到「规范写得够不够具体」。

二、第一步:把标签规范写成能判案的规则,尤其是夹缝样本

标签规范不要写成「情感」这种一个词就完了,要写成能拿来判案的规则。三条要求:

  1. 每个标签给一条正向定义、一条反例。反例比正例更能拉开边界。「这条是负面」不如「这条虽然提到了问题,但整体是在提建议,算中性」。
  2. 夹缝样本单独拎出来定规则。反问句、反讽、引用别人的观点、带条件的好评——这几类是分歧高发区,要提前规定怎么算,并各留两三个样板备查。
  3. 标签之间尽量互斥且穷尽。如果一条数据看着像两个标签都能套,那大概率是标签体系设计得有问题,而不是数据有问题。

这一步做扎实,后面的返工会少一大半。

三、第二步:让模型做预标注,但只有高置信度才直通

用 Agent 做预标注能省很多时间,关键是不要一视同仁地信任它。做法是按置信度分流:

  • 高置信度 → 直通。不用人逐条过,但必须进抽样复核(见第五步)。
  • 中置信度 → 人工确认。这是人工主要花时间的地方,也是价值最高的地方。
  • 低置信度 → 直接进待定池。不要硬给一个标签,让它空着比让它错着好。

还有一个细节很值得加:让模型在给标签的同时给一句理由。理由不是给人看的装饰,而是复核时的抓手——只看理由,往往几秒就能判断对不对,比重新把原文读一遍快得多。

这里还有一个偏差要特别防:别把模型的输出反过来当成标准去校准人。预标注只是加速器,最终的裁判权永远在人手上。至于评分这件事本身会带哪些偏差,LLM 当裁判的评分器怎么设计 里讲得更细。

四、第三步:一致性校验,别只算一个百分比

「一致率 85%」这种说法没什么用,要拆开看:

  • 整体一致率。只反映个大概水平,做汇报可以,做决策不够。
  • 逐标签一致率。哪几个标签分歧最大,一眼就能看出来,直接对应到要修的规范。
  • 夹缝样本一致率。这个数最重要。整体 90%、夹缝样本 60%,说明流程还不能信。
  • 分歧的方向。是两个人在两个标签之间摇摆,还是某一个人的标准整体偏离?前者是规范问题,后者是培训问题,处理方式完全不同。

做法上,不要只让两个人各标一遍就算完,要让一部分样本被多人重复标注,尤其是新标签上线后的前几批。重复标注的样本不用多,但必须覆盖夹缝样本。

五、第四步:分层抽检,把分歧样本回炉

抽检不能只抽随机样本。随机抽样会把夹缝样本稀释掉,而恰恰是那些样本最容易错。抽样要分层:

  • 按标签分层,每个标签都要抽到,哪怕它只有几条。
  • 按置信度分层,低置信度和被人工改过的样本多抽一点。
  • 按来源分层,模型直通的和人工标的分开抽,才能分别估误差。

抽检出问题后的处置分三层:单条错误直接改;同一个标签连续出错,就回炉重标该标签下的样本;如果是规范本身有歧义,那就先改规范,然后回标已经通过的那一批——这一层最容易被跳过,但它的收益也最大。分层抽检的具体落地方式,可以参考 人工复核抽检怎么分层。

六、五个常见的坑

  1. 标签定义还很模糊就开工。省下的那半天,后面要用好几天来还。
  2. 只标典型样本。数据集里全是好认的例子,模型上线后一碰到夹缝样本就现原形。
  3. 把预标注结果当金标准。模型错的地方人跟着错,还觉得自己是在「确认」。
  4. 不留溯源。每条数据要能回答「谁标的、什么时候标的、按第几版规范标的」。不然后期出问题根本查不动,审计查询字段怎么设计 里那套留痕思路,放在标注上一样管用。
  5. 标完就不管了。标签会随业务漂移——今天算负面的一句话,三个月后可能就算中性了。要有定期抽检和版本意识。

七、适合谁用,不适合谁用

适合:要做分类器、做评测集、做内部数据治理的团队;数据量在几千到几万条之间、人工标不完但也不至于请一个大团队的场景。这类规模用「模型预标注 + 人工集中处理难样本」的性价比最高。

不太适合:需要极高准确率的合规判定,这一类必须由专业人员终审,AI 只能做初筛;以及数据量小到几十条的场合——这种直接人工标两遍,比搭一套流程更快也更可靠。

总结

用 AI Agent 做数据标注,真正省时间的地方不在「标」这个动作,而在用置信度分流把人的注意力集中到难样本上,再用一致性校验和分层抽检把误差兜住。规范写清楚、理由带出来、分歧能回炉,这三点做到,监督信号才算真的可用——不然标得再多,也只是把错误规模化了一遍。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *