跳到主内容
快讯直播
AI智模界
AI 词典

数据配比:决定模型偏科的那只旋钮

一句话定义:数据配比(Data Mixture)就是在预训练(Pre-training)阶段,把代码、中文、数学、通用网页文本等各类语料,按什么比例混在一起喂给模型。

打个比方:这像给一个正在长身体的孩子配餐。米饭、肉、青菜、甜点各占多少,决定他将来是健壮、挑食还是虚胖。模型的"食物"就是网页、代码仓库、数学题解、书籍、多语言语料。总饭量相同、配比不同,会长出两个脾气完全不同的模型。

为什么影响这么大:预训练的本质是"预测下一个词",模型在哪类文本上见得多,就在那类分布上被压得更准。代码里全是严格的括号、缩进、变量引用和一步步推导,代码见得多的模型,处理长链条推理往往更稳;数学语料提供符号运算和严密步骤;中文语料的多少,直接决定它说中文是自然还是"翻译腔"。

配比不是越多越好,而是此消彼长——训练预算固定,加一类等于减另一类。

数据类型类比占比偏高占比偏低
代码逻辑体操推理链条稳,但说话像写文档长步骤推理容易断
数学举铁符号运算强,表达偏干巴算数、证明类任务吃力
中文母语环境中文语感自然,跨语言迁移可能变弱中文别扭、生硬
通用网页杂食世界知识面广,噪声也一起进来常识与知识面变窄

和相邻概念的区别:数据配比管的是"各类吃多少";数据质量与清洗(去重、过滤、去毒)管的是"吃得干不干净";数据规模管的是"总共吃多少";而上采样/下采样(upsampling / downsampling)、温度采样(temperature sampling)只是把既定配比落到每个批次里的技术手段。还有一个常被混为一谈的是课程学习(Curriculum Learning),它管的是"先吃什么后吃什么",属于顺序而非比例。

对从业者的意义:模型出现明显偏科时,先怀疑配比,再怀疑超参。做垂类模型时,基座在预训练阶段的中文、代码占比,往往已经决定了能力天花板,微调AI 词典:Fine-tuning">Fine-tuning)只能补一部分。微调阶段同样有配比问题,只是数据量小得多。

对普通职场人的意义:同一个底座、不同配比,出来的模型擅长的事差别很大。选模型别只问"多少参数",可以问一句"它训练时看了多少中文和代码"。为什么有的模型写中文很顺、有的算数老出错、有的特别爱用列表回答,答案常常藏在这只最不显眼的旋钮里。

各家具体怎么配属于核心机密,公开技术报告通常也只给大致区间,真要落到某个模型,以官方技术报告或官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。