跳到主内容
快讯直播
AI智模界
AI 词典

涌现能力(Emergent Abilities):大模型「突然就会了」,是真的吗?

一句话定义:涌现能力(Emergent Abilities)指模型规模——参数量、训练数据、算力——跨过某个门槛后,在小模型上完全测不出来、在大模型上却明显表现出来的能力。

原理,打个比方

水从 20°C 烧到 99°C,看着都没什么动静;再加一度,整锅水突然沸腾。水分子一直在加速,但只有跨过 100°C,宏观上才冒出「沸腾」这个新状态。

涌现能力常被描述成类似现象:小模型做多步数学题几乎全错,规模翻几倍后分数突然抬起来。常被点名的例子有:多步推理、听从指令做事、看几个例子就学会新任务(AI 词典:上下文学习">上下文学习,in-context learning)。

但「突然」是真的吗?

这是这个词最有争议的地方。一派认为涌现是真实的相变;另一派认为,很大程度是评测指标造成的错觉。

关键在于指标怎么选:

  • 用「整道题答案完全正确才算对」(精确匹配,exact match)这类全有全无的指标时,小模型答对一半步骤也拿 0 分。它的真实水平其实一直在慢慢涨,只是分数卡在 0,直到某天多对一步,分数才「跳」起来。
  • 换成「每个词元预测得准不准」(token-level accuracy)这类连续、更细的指标,曲线往往就是平滑上升,看不到台阶。

所以比较公允的说法是:能力随规模提升本身是连续的;但「突然出现」这个观感,相当一部分来自我们选了会放大跳变的指标。真实存在的、非线性的能力跃迁有没有,学界仍无定论。

对比涌现能力缩放定律Scaling Laws
描述对象某个具体任务上的表现训练损失随规模的走势
曲线形状看起来是台阶式突变平滑的幂律下降
主要争议「突变」有多少是评测假象相对稳定、可外推

和相邻概念的区别

缩放定律说的是损失平滑下降,涌现说的是任务表现跳变——两者不矛盾,一个在底层指标,一个在上层任务。另外「顿悟」(grokking)指训练到某个步数后泛化能力忽然变好,那是训练时间轴上的突然,不是规模轴上的。

对从业者和普通人的意义

  • 小模型上「试不出来」,不能直接推断大模型也不行。别用一个小模型的结果否定整个技术方向。
  • 曲线跳不跳,和你选的评测指标强相关。写结论、看别人的结论,都先问一句:用的什么指标。
  • 选型时更稳的做法,是在目标规模上直接实测,而不是拿论文曲线外推。
  • 对普通人,这意味着两头都别迷信:别以为「参数越大越神」,也别指望一个小模型什么都能干。看到「模型突然学会了 XX」,先看它用什么指标衡量。

具体到某个模型的能力边界、定价和版本,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。