μP(Maximal Update Parametrization,最大更新参数化)是一套关于神经网络「宽度变大时,每一层的初始化和学习率该怎么设定」的规则;μTransfer(超参数迁移)是它最实用的用法:在几千万参数的小模型上把学习率、初始化尺度等超参数扫好,然后原样搬到大几百倍宽的模型上,结果仍然接近最优。
问题出在哪
在框架默认的参数化(Standard Parametrization,SP)下,把模型加宽,最优学习率会明显漂移。原因不难理解:一层里要累加的计算项随宽度变多,如果每项的量级不变,这一层的输出和梯度量级就会随宽度一起涨。于是你在窄模型上试出来的「学习率 3e-4」,放到宽模型上不是发散就是学得太慢,必须重新扫一遍。
μP 的做法是逐层改写规则:哪些层的初始化方差要随宽度怎么变、哪些矩阵乘的学习率要乘上一个与宽度相关的因子,都规定好。这样在网络宽度趋于无穷时,每一层的更新幅度都保持在同一量级,不会因为变宽而失衡。既然各层的「音量」都被校准过,那个总音量旋钮(学习率)的合适位置自然就不随宽度移动了。
打个比方
一个 10 人合唱团和一个 500 人合唱团,如果每个人都用同样的音量唱,大团就是一场轰鸣。好的做法是规定「每个人的音量随总人数调整」,让整体响度始终一致。这样一来,指挥心里那个「整体该多响」的标准,在大小团里是通用的。μP 就是那条规定,学习率就是指挥的标准。
| 标准参数化(SP) | μP | |
|---|---|---|
| 初始化与学习率 | 用框架默认设置 | 逐层按宽度缩放 |
| 宽度变大后最优学习率 | 明显漂移,需重扫 | 基本不动 |
| 小模型超参搬到大模型 | 不可靠 | 可以(μTransfer) |
| 理论上追求的状态 | 偏向惰性训练、核极限 | 保持有限而稳定的特征学习 |
和相邻概念的区别
它和「学习率随 batch size 缩放」不是一件事:后者管的是数据并行批次大小,μP 管的是模型宽度。它和迁移学习也不同:迁过来的是超参数,不是权重。它也不是「随便搜搜」——普通超参搜索只是在小模型上搜,搜完未必能搬;μP 提供的是让「搬过去」成立的那套缩放条件。
对从业者的意义
大模型训练里,超参搜索常常比训练本身还贵。μTransfer 把最花钱的那部分挪到小模型上做,再到大模型上做少量短跑确认即可。代价是:代码里得真的按 μP 实现——嵌入层、注意力、AI 词典:LayerNorm">LayerNorm、输出层的处理都有讲究,通常要借助专门的开源实现或自己改写参数组,细节请以所用工具的官方文档为准。如果只是「改了个初始化」,迁移往往会失效。
对不训练模型的人来说,这背后的信号也很直白:大模型的成本,有很大一块花在试参数上,而这类工作正是一点点把它压下来。
