一句话定义:合成数据(Synthetic Data)指不是从真实世界直接采集,而是由程序、仿真环境或生成式模型造出来的数据。
原理:自己下蛋自己孵
真实数据像从菜市场买来的食材,合成数据像厨房机器“打印”出来的食材。打印配方可以来自规则、物理引擎,也可以来自大模型。比如让模型生成客服对话、代码、医学影像,或让游戏引擎生成自动驾驶路测画面。
问题出在循环:模型生成一批数据,筛选后训练下一代模型,下一代再生成数据……如果每代都只吃自己产出的数据,数据分布会收窄,罕见样本消失,错误被继承和放大。这就是常说的模型崩溃(Model Collapse)。好比只拿上一顿剩菜当原料,越做越单调,最后连“正常味道”都丢了。
但循环不等于必然中毒。若持续混入真实数据、保持多样性、做去重和质量过滤、加入人类反馈,合成数据可以当“补充粮”,而不是“唯一粮”。
和相邻概念的区别
| 类型 | 来源 | 主要风险 |
|---|---|---|
| 真实数据 | 直接采集 | 贵、隐私、长尾少 |
| 增强数据(Data Augmentation) | 对真实样本做变换 | 多样性有限 |
| 合成数据 | 生成模型或仿真 | 分布偏移、自我中毒 |
| 伪标签(Pseudo-labeling) | 真实无标数据加模型标注 | 错误累积 |
数据增强的根还是真实样本;仿真数据(Simulation Data)通常指物理引擎或规则生成,是合成数据的一种;伪标签的数据本身仍来自真实世界。
对从业者和普通人的意义
从业者常用合成数据做冷启动、长尾补充、隐私合规和评测集。关键是别闭环:保留真实数据锚点,记录数据血缘,按代际监控分布变化。普通人则要知道,你看到的 AI 生成内容可能被用于训练;它不等于假,但来源和比例很关键。平台若只用合成数据刷量,短期省事,长期可能越训越窄。具体工具和模型策略以官方页面为准。
