跳到主内容
快讯直播
AI智模界
AI 词典

神经正切核:把无限宽网络看成核方法

神经正切核(Neural Tangent Kernel, NTK)是一把尺子:它衡量神经网络里,两个输入样本让输出发生变化的“方向”有多像;在宽度趋于无穷时,它把神经网络的训练变成核方法(kernel method)。

先看一个具体场景。你有一个很宽的全连接网络,输入 x,输出 f(x)。训练时用梯度下降(gradient descent)调参数。NTK 的定义是:对任意两个样本 x 和 x',分别求网络输出对全体参数的梯度,再做内积。这个内积越大,说明 x 和 x' 在参数空间里“推动网络”的方式越接近。它像一张相似度表:不是看原始输入像不像,而是看网络当前把二者当作多像。

神奇之处在于宽度。当隐藏层宽度趋于无穷、参数初始化按合适方式缩放、学习率足够小时,这张相似度表在整个训练过程中几乎不变。于是训练动力学等价于用固定核做核回归(kernel regression):网络输出始终是训练样本的核函数组合。这叫“懒惰训练”(lazy training):参数只动一点点,模型懒得重新学特征,主要靠初始化时的随机特征。

这就回答了“为什么能训得动”。普通非凸优化很难,但在无限宽极限下,损失面在初始化附近近似线性、近似凸,梯度下降沿 NTK 的谱方向把误差一点点压下去。NTK 的特征值大小决定收敛速度:大特征值方向学得快,小特征值方向学得慢。宽度越宽,核越稳,优化越容易。

和相邻概念的区别:

概念核是否变化是否学特征典型视角
NTK 极限训练中固定几乎不学无限宽、核方法
有限宽网络随训练变化会学实际深度学习
经典核方法人为设定不学支持向量机、高斯过程

所以 NTK 不是“所有神经网络都等于核方法”。它描述的是一个极限情形。真实网络宽度有限,NTK 会漂移,这种漂移正是特征学习(feature learning)的来源,也是大模型比固定核更强的原因。

对从业者的实际意义:第一,调宽度、初始化方差和学习率时,NTK 给出一个统一尺度——太大或太小可能让网络进入懒惰或爆炸 regime。第二,理解大模型为何相对好训:过参数化让损失面更平滑,优化更像核回归。第三,别把 NTK 当性能上限;它解释的是可训练性,不是智能。对普通人,可以把它想成:网络很宽时,训练更像“查表插值”,而不是“重新发明特征”。具体实现和最新结论以官方论文和代码为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。