神经正切核(Neural Tangent Kernel, NTK)是一把尺子:它衡量神经网络里,两个输入样本让输出发生变化的“方向”有多像;在宽度趋于无穷时,它把神经网络的训练变成核方法(kernel method)。
先看一个具体场景。你有一个很宽的全连接网络,输入 x,输出 f(x)。训练时用梯度下降(gradient descent)调参数。NTK 的定义是:对任意两个样本 x 和 x',分别求网络输出对全体参数的梯度,再做内积。这个内积越大,说明 x 和 x' 在参数空间里“推动网络”的方式越接近。它像一张相似度表:不是看原始输入像不像,而是看网络当前把二者当作多像。
神奇之处在于宽度。当隐藏层宽度趋于无穷、参数初始化按合适方式缩放、学习率足够小时,这张相似度表在整个训练过程中几乎不变。于是训练动力学等价于用固定核做核回归(kernel regression):网络输出始终是训练样本的核函数组合。这叫“懒惰训练”(lazy training):参数只动一点点,模型懒得重新学特征,主要靠初始化时的随机特征。
这就回答了“为什么能训得动”。普通非凸优化很难,但在无限宽极限下,损失面在初始化附近近似线性、近似凸,梯度下降沿 NTK 的谱方向把误差一点点压下去。NTK 的特征值大小决定收敛速度:大特征值方向学得快,小特征值方向学得慢。宽度越宽,核越稳,优化越容易。
和相邻概念的区别:
| 概念 | 核是否变化 | 是否学特征 | 典型视角 |
|---|---|---|---|
| NTK 极限 | 训练中固定 | 几乎不学 | 无限宽、核方法 |
| 有限宽网络 | 随训练变化 | 会学 | 实际深度学习 |
| 经典核方法 | 人为设定 | 不学 | 支持向量机、高斯过程 |
所以 NTK 不是“所有神经网络都等于核方法”。它描述的是一个极限情形。真实网络宽度有限,NTK 会漂移,这种漂移正是特征学习(feature learning)的来源,也是大模型比固定核更强的原因。
对从业者的实际意义:第一,调宽度、初始化方差和学习率时,NTK 给出一个统一尺度——太大或太小可能让网络进入懒惰或爆炸 regime。第二,理解大模型为何相对好训:过参数化让损失面更平滑,优化更像核回归。第三,别把 NTK 当性能上限;它解释的是可训练性,不是智能。对普通人,可以把它想成:网络很宽时,训练更像“查表插值”,而不是“重新发明特征”。具体实现和最新结论以官方论文和代码为准。
