一句话定义:在给定模型规模下,故意喂给它远超"计算最优"比例的数据,让模型练得"过火"——训练更贵,但换来一个又小又聪明的模型,日后每次推理都更便宜。
为什么以前不这么干
2022 年 DeepMind 的 Chinchilla 缩放律给出一个反直觉结论:在固定训练算力下,模型参数量和训练数据量应该大致同比例增长(业内常引用的经验比例是每个参数配二十来个 token 的量级)。此前的大模型普遍"个头大、喂得少",属于欠训练——参数堆了很多,数据却不够,算力花得不值。
于是"计算最优"成了一个共识:给定算力预算,按比例配参数和数据,训练损失最低。
Chinchilla 之后为什么转向
问题在于,Chinchilla 优化的只是训练这一次性的开销。可模型是要上线服务的:如果它每天要被调用上亿次,推理成本会远远超过训练成本。
打个比方:开一家连锁餐厅。"计算最优"是花最少的时间研发出一份还行的菜谱——如果这家店一天只出十桌,这当然最划算。但如果它一天要出十万份,你宁愿多花三个月把菜谱打磨到极致,让每份出餐快 15%、用料省一点。研发多花的时间是一次性的,省下的成本是每天的。
模型也一样:把一个 7B 的模型喂到远超计算最优的数据量,训练算力多花好几倍,但换来的效果可能接近一个大得多的模型,而推理时的显存、延迟、单价仍然是 7B 的水平。近几年的开源小模型几乎都走这条路,公开的 token 数往往是 Chinchilla 比例的好几倍甚至十几倍。
和相邻概念的区别
最容易被混淆的是过拟合(Overfitting)——那是训练"学歪了",训练集上表现好、新数据上变差,是贬义。而这里说的过度训练是刻意为之的工程取舍,泛化能力仍在变好,只是没把训练算力花在"最划算"的点上。
| 策略 | 数据量相对模型 | 训练成本 | 推理成本 | 典型场景 |
|---|---|---|---|---|
| 欠训练 | 偏少 | 浪费算力 | 高 | 早期大模型 |
| 计算最优 | 按比例 | 最省 | 偏高 | 一次性任务、低并发 |
| 过度训练 | 超量数倍 | 更贵 | 低 | 高并发、端侧部署 |
对你我意味着什么
对从业者:选型时,"同尺寸但数据喂得更多"的模型通常更强,别只看参数量;自己微调时,如果目标是高并发上线,值得优先考虑这类小模型而不是更大的底座。反过来,做一次性离线分析、并发极低的场景,过度训练就是白花的钱。
对普通人:你手机里、笔记本上能跑起来的模型越来越聪明,很大程度上就是这条思路的成果——大模型的智力,小模型的身价。
最后提醒一句:具体某个模型的训练数据量、算力配置以官方页面为准,各家口径并不统一。
