一句话:数据增强(Data Augmentation)就是在不改变样本"含义"的前提下,对已有数据做各种变换,变出一批"新"样本去训练模型——靠变换扩样本,而不是靠重新标注。
打个比方:一张猫的照片,左右翻转、调亮一点、随机裁掉边角,像素全变了,但"这是一只猫"没变。让模型见过这些变体,它就不会只记住原图那一种样子,遇到角度、光线不同的猫也认得出。
常见招式
- 图像:翻转、旋转、裁剪、缩放、色彩抖动、加噪声、随机遮挡(Cutout)、把两张图按比例叠着混(Mixup)
- 文本:同义词替换、随机删除或插入词、句子重排、回译(译成另一种语言再译回来)
- 语音:变速、变调、叠加背景噪声、模拟不同房间的混响
- 表格与时序:加微小扰动、滑动窗口切分、时间轴抖动
它和几个"邻居"的区别
| 做法 | 数据从哪来 | 标签从哪来 | 主要目的 |
|---|---|---|---|
| 数据增强 | 变换已有样本 | 跟着变换走,通常不变 | 提升泛化、缓解小数据 |
| 数据标注 | 新采集或未标注数据 | 人工或半自动打 | 补上真实分布 |
| 合成数据 | 由生成模型或仿真从零造 | 一并生成 | 造出罕见场景 |
还有一个容易混的:正则化(Regularization)。AI 词典:Dropout">Dropout、权重衰减是"在模型上"防过拟合;数据增强是"在数据上"防过拟合,所以常被叫作数据端的正则化。
一条铁律:标签得跟着走
把一张写着"b"的图水平翻转,它就成"d"了。这时候增强不是在帮忙,是在教模型学错。所以每做一步变换都要问:语义变了吗?医疗影像左右翻转未必成立,文字识别不能做镜像,目标检测旋转之后检测框也得跟着转。增强策略要按任务来定,不能照搬别人的清单。
对从业者的实际意义
数据不够、类别不平衡、长尾类别只有几十条时,数据增强往往是性价比最高的一招:不用重新标注,改几行配置就能试。它算得上是"免费的涨点"手段之一,但也有边界——它只能把已有样本的邻域铺开,造不出模型从没见过的新模式,别指望它替代真实数据。强度也要调,变换太猛等于往训练集里灌噪声,验证集上的表现会告诉你过头没有。
对普通职场人的理解版本:同一个动作,换着姿势练一百遍,比死记一份标准答案更抗打。
具体到某个框架怎么实现、有哪些内置算子,以各项目官方文档为准。
