一句话定义:数据配比(Data Mixture)就是在预训练(Pre-training)阶段,把代码、中文、数学、通用网页文本等各类语料,按什么比例混在一起喂给模型。
打个比方:这像给一个正在长身体的孩子配餐。米饭、肉、青菜、甜点各占多少,决定他将来是健壮、挑食还是虚胖。模型的"食物"就是网页、代码仓库、数学题解、书籍、多语言语料。总饭量相同、配比不同,会长出两个脾气完全不同的模型。
为什么影响这么大:预训练的本质是"预测下一个词",模型在哪类文本上见得多,就在那类分布上被压得更准。代码里全是严格的括号、缩进、变量引用和一步步推导,代码见得多的模型,处理长链条推理往往更稳;数学语料提供符号运算和严密步骤;中文语料的多少,直接决定它说中文是自然还是"翻译腔"。
配比不是越多越好,而是此消彼长——训练预算固定,加一类等于减另一类。
| 数据类型 | 类比 | 占比偏高 | 占比偏低 |
|---|---|---|---|
| 代码 | 逻辑体操 | 推理链条稳,但说话像写文档 | 长步骤推理容易断 |
| 数学 | 举铁 | 符号运算强,表达偏干巴 | 算数、证明类任务吃力 |
| 中文 | 母语环境 | 中文语感自然,跨语言迁移可能变弱 | 中文别扭、生硬 |
| 通用网页 | 杂食 | 世界知识面广,噪声也一起进来 | 常识与知识面变窄 |
和相邻概念的区别:数据配比管的是"各类吃多少";数据质量与清洗(去重、过滤、去毒)管的是"吃得干不干净";数据规模管的是"总共吃多少";而上采样/下采样(upsampling / downsampling)、温度采样(temperature sampling)只是把既定配比落到每个批次里的技术手段。还有一个常被混为一谈的是课程学习(Curriculum Learning),它管的是"先吃什么后吃什么",属于顺序而非比例。
对从业者的意义:模型出现明显偏科时,先怀疑配比,再怀疑超参。做垂类模型时,基座在预训练阶段的中文、代码占比,往往已经决定了能力天花板,微调(AI 词典:Fine-tuning">Fine-tuning)只能补一部分。微调阶段同样有配比问题,只是数据量小得多。
对普通职场人的意义:同一个底座、不同配比,出来的模型擅长的事差别很大。选模型别只问"多少参数",可以问一句"它训练时看了多少中文和代码"。为什么有的模型写中文很顺、有的算数老出错、有的特别爱用列表回答,答案常常藏在这只最不显眼的旋钮里。
各家具体怎么配属于核心机密,公开技术报告通常也只给大致区间,真要落到某个模型,以官方技术报告或官方页面为准。
