一句话定义:数据标注(Human Annotation)是让真人把原始数据加工成模型可学习的“答案”。给图片框物体、给文本标情感、把语音转成文字、给两个回答排序,都是标注。
原理与比方:模型不会天生懂世界,它靠大量样本统计规律。标注就是它的教材。教小孩认猫,如果大人一会儿指猫说“猫”,一会儿指狗也说“猫”,孩子必然学歪。模型更惨:它没有常识,错标会被当成真理反复学习。标注规范(annotation guideline)因此关键,它把“这条评论算不算负面”这类模糊判断,变成可执行、可复核的规则。
与相邻概念的区别:
| 概念 | 做什么 | 典型产出 |
|---|---|---|
| 数据标注 | 人对样本做语义判断 | 标签、排序、改写、转写 |
| 数据清洗(Data Cleaning) | 去重、纠错、统一格式 | 更干净的原始数据 |
| 特征工程(Feature Engineering) | 人设计模型输入 | 数值或向量特征 |
| 合成数据(AI 词典:Synthetic Data">Synthetic Data) | 模型生成样本 | 候选训练数据 |
标注和清洗常一起出现,但清洗不一定要理解语义;特征工程偏“喂什么”,标注偏“答案是什么”。偏好标注(Preference Annotation)也是标注,常用于让模型学会更像人想要的结果。
对从业者的意义:标注质量决定模型天花板。错标、漏标、多人标准不一致,会把噪声变成监督信号;评测集标注不严,指标会虚高,上线才暴露。它却常是流水线里最不被认真对待的一环:预算先砍、规范只有几页、外包层层转包、抽检和仲裁缺失。更靠谱的做法是像对待代码一样对待标注:写清规范、先培训试标、双人标注加仲裁、定期抽检、记录分歧和版本。具体工具与流程因平台而异,以官方页面为准。
对普通人的意义:你用的 AI 好不好,背后是很多人的判断。若参与标注,认真不是形式,而是在给模型划边界、定口味。涉及个人信息时,先脱敏、守合规。
