跳到主内容
快讯直播
AI智模界
AI 词典

缩放定律(Scaling Laws):为什么大厂敢重金堆算力?

一句话定义:缩放定律(Scaling Laws)指在 AI 模型训练中,当算力、数据量、参数量一起扩大时,模型在语言建模等任务上的误差会按相对稳定的规律下降。它更像经验曲线,不是物理定律。

打个比方:训练大模型像开一家中央厨房。参数量是厨师数量,数据是菜谱和食材,算力是炉灶和出餐时间。刚开始加厨师、加食材,出菜能力会明显提升;继续加,提升不会停,但每加一倍投入,带来的进步会变小。这就像考试从 60 分到 80 分容易,从 95 分到 98 分难。缩放定律要说的正是:这种“投入—进步”关系在多个数量级内相当可预测,于是公司可以在训练前用较小实验拟合曲线,估算大模型大概能到哪。若曲线显示加十倍算力能显著降低错误率,预算就有依据。

但关键不是只堆参数量。数据不够,参数再多也会“死记硬背”或欠训练;算力不够,大模型也训不动。后来业界更强调“算力最优”:给定训练预算,参数量和数据量要搭配增长,而不是只把模型做大。数据质量、架构、优化方法也会影响曲线位置。

和相邻概念的区别:缩放定律不等于摩尔定律。摩尔定律描述硬件晶体管密度和成本的长期趋势;缩放定律描述模型表现随训练规模的变化。它也不等于“涌现能力”那种某能力突然出现的说法,缩放定律更多是平滑的误差下降趋势。它更不是保证:曲线外推可能失效,数据枯竭、推理成本、能耗和监管都会成为限制。

对从业者,它的实际意义是把“要不要投更多算力”变成可做实验、可做预算的工程决策。对普通职场人,可以理解为:AI 能力提升常常不是靠灵光一现,而是靠可复制的投入产出曲线;但投入越大,边际收益、数据质量和落地成本越要精算。具体模型、价格、版本和效果,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。