跳到主内容
快讯直播
AI智模界
AI 词典

Grokking:训练早就不动了,为什么突然开窍

一句话定义

Grokking(顿悟 / 延迟泛化)指的是:模型在训练集上早就做到了接近零误差,验证集却长时间停留在"瞎猜"水平,然后在继续训练很久之后,验证指标突然跳升到接近满分。

关键词是"继续训练"。如果你在验证曲线平坦的那一段就停了手,你只会拿到一个死记硬背的模型。

打个比方

一个学生反复刷同一套习题。前几百遍,他把答案背下来了:小测(训练集)满分,换一道题(验证集)就崩。此时他脑子里的"解"是查表——看到这题,输出那个答案。

但老师每轮都扣一点"复杂度分"(对应训练里的权重衰减 weight decay),逼他少用死记的条目。背着背着,查表那条路被磨平了,他被迫去找规律。某一天规律对上了,正式考试也满分。曲线画出来就是:一段长长的平台,然后一个台阶。

为什么会"顿"一下

模型在参数空间里搜索时,先找到的往往是容易找到但很笨的解(记忆),后找到的才是难找但简洁的解(泛化)。正则化像一股缓慢的推力,持续把参数往简洁的方向推;当推力积累到某个临界点,模型就从记忆解"迁移"到了泛化解。

记忆解泛化解
何时被找到很早很晚
参数规模 / 范数
依赖训练样本的程度
换个数据分布容易崩相对稳

别和这两个概念搞混

  • 双下降(double descent):横轴通常是模型规模,测试误差先降、再升、再降。Grokking 的横轴是训练时间,而且训练误差从头到尾都很好。
  • 涌现能力(emergent abilities):指的是随模型规模变大,某种能力突然出现。Grokking 是同一个模型在训练过程中突然开窍。一个看规模轴,一个看时间轴。

对从业者意味着什么

1. 早停会误杀。 验证集平坦不等于没希望,在小数据、强正则的设定下尤其如此。看到 train/test 之间的巨大且稳定的鸿沟时,可以想想"它是不是正在漂移"。

2. 训练预算要够长。 这类现象往往需要远超常规收敛点的步数才观察得到,按"训练误差不降了就停"的直觉排预算会很吃亏。

3. 数据越少、任务越像"有规律可循"的小算法题,越容易看到它。 在真实大模型任务上它常被噪声淹没,不容易复现。

4. 对普通人也成立。 学一个新技能,常见曲线就是"先靠套路应付,平台期很长,某天突然通了"。平台期不等于天花板。

最后一句务实的提醒:要不要继续训、什么时候停,最终得看你这个任务的验证曲线和算力成本,别拿别人的曲线当自己的标准,具体以你自己的实验为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。