跳到主内容
快讯直播
AI智模界
AI 词典

数据增强:把一份数据用出十份的价值

一句话:数据增强(Data Augmentation)就是在不改变样本"含义"的前提下,对已有数据做各种变换,变出一批"新"样本去训练模型——靠变换扩样本,而不是靠重新标注。

打个比方:一张猫的照片,左右翻转、调亮一点、随机裁掉边角,像素全变了,但"这是一只猫"没变。让模型见过这些变体,它就不会只记住原图那一种样子,遇到角度、光线不同的猫也认得出。

常见招式

  • 图像:翻转、旋转、裁剪、缩放、色彩抖动、加噪声、随机遮挡(Cutout)、把两张图按比例叠着混(Mixup)
  • 文本:同义词替换、随机删除或插入词、句子重排、回译(译成另一种语言再译回来)
  • 语音:变速、变调、叠加背景噪声、模拟不同房间的混响
  • 表格与时序:加微小扰动、滑动窗口切分、时间轴抖动

它和几个"邻居"的区别

做法数据从哪来标签从哪来主要目的
数据增强变换已有样本跟着变换走,通常不变提升泛化、缓解小数据
数据标注新采集或未标注数据人工或半自动打补上真实分布
合成数据由生成模型或仿真从零造一并生成造出罕见场景

还有一个容易混的:正则化(Regularization)。AI 词典:Dropout">Dropout、权重衰减是"在模型上"防过拟合;数据增强是"在数据上"防过拟合,所以常被叫作数据端的正则化。

一条铁律:标签得跟着走

把一张写着"b"的图水平翻转,它就成"d"了。这时候增强不是在帮忙,是在教模型学错。所以每做一步变换都要问:语义变了吗?医疗影像左右翻转未必成立,文字识别不能做镜像,目标检测旋转之后检测框也得跟着转。增强策略要按任务来定,不能照搬别人的清单。

对从业者的实际意义

数据不够、类别不平衡、长尾类别只有几十条时,数据增强往往是性价比最高的一招:不用重新标注,改几行配置就能试。它算得上是"免费的涨点"手段之一,但也有边界——它只能把已有样本的邻域铺开,造不出模型从没见过的新模式,别指望它替代真实数据。强度也要调,变换太猛等于往训练集里灌噪声,验证集上的表现会告诉你过头没有。

对普通职场人的理解版本:同一个动作,换着姿势练一百遍,比死记一份标准答案更抗打。

具体到某个框架怎么实现、有哪些内置算子,以各项目官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。