一句话定义:涌现能力(Emergent Abilities)指模型规模——参数量、训练数据、算力——跨过某个门槛后,在小模型上完全测不出来、在大模型上却明显表现出来的能力。
原理,打个比方
水从 20°C 烧到 99°C,看着都没什么动静;再加一度,整锅水突然沸腾。水分子一直在加速,但只有跨过 100°C,宏观上才冒出「沸腾」这个新状态。
涌现能力常被描述成类似现象:小模型做多步数学题几乎全错,规模翻几倍后分数突然抬起来。常被点名的例子有:多步推理、听从指令做事、看几个例子就学会新任务(AI 词典:上下文学习">上下文学习,in-context learning)。
但「突然」是真的吗?
这是这个词最有争议的地方。一派认为涌现是真实的相变;另一派认为,很大程度是评测指标造成的错觉。
关键在于指标怎么选:
- 用「整道题答案完全正确才算对」(精确匹配,exact match)这类全有全无的指标时,小模型答对一半步骤也拿 0 分。它的真实水平其实一直在慢慢涨,只是分数卡在 0,直到某天多对一步,分数才「跳」起来。
- 换成「每个词元预测得准不准」(token-level accuracy)这类连续、更细的指标,曲线往往就是平滑上升,看不到台阶。
所以比较公允的说法是:能力随规模提升本身是连续的;但「突然出现」这个观感,相当一部分来自我们选了会放大跳变的指标。真实存在的、非线性的能力跃迁有没有,学界仍无定论。
| 对比 | 涌现能力 | 缩放定律(Scaling Laws) |
|---|---|---|
| 描述对象 | 某个具体任务上的表现 | 训练损失随规模的走势 |
| 曲线形状 | 看起来是台阶式突变 | 平滑的幂律下降 |
| 主要争议 | 「突变」有多少是评测假象 | 相对稳定、可外推 |
和相邻概念的区别
缩放定律说的是损失平滑下降,涌现说的是任务表现跳变——两者不矛盾,一个在底层指标,一个在上层任务。另外「顿悟」(grokking)指训练到某个步数后泛化能力忽然变好,那是训练时间轴上的突然,不是规模轴上的。
对从业者和普通人的意义
- 小模型上「试不出来」,不能直接推断大模型也不行。别用一个小模型的结果否定整个技术方向。
- 曲线跳不跳,和你选的评测指标强相关。写结论、看别人的结论,都先问一句:用的什么指标。
- 选型时更稳的做法,是在目标规模上直接实测,而不是拿论文曲线外推。
- 对普通人,这意味着两头都别迷信:别以为「参数越大越神」,也别指望一个小模型什么都能干。看到「模型突然学会了 XX」,先看它用什么指标衡量。
具体到某个模型的能力边界、定价和版本,以官方页面为准。
