一句话:KAN(Kolmogorov–Arnold Network)是把神经网络里的线性权重,换成可学习一元函数的架构。
MLP(Multilayer Perceptron,多层感知机)的神经元做“加权求和 + 固定激活”,权重是数字。KAN 反过来:节点主要做加法,边上的连接不是数字,而是一条可学习一元函数。输入经过函数,再把结果相加;这些函数常用 B-spline(B样条)等可调曲线表示。打个比方:MLP 像用固定形状积木,只调每块放多大;KAN 像每条连接装一根可弯折金属丝,学习就是弯折它们。依据是 Kolmogorov–Arnold 表示定理:多元连续函数可由一元函数和加法组合逼近。于是 KAN 用“函数边 + 加法节点”拟合复杂关系。
| 维度 | MLP | KAN |
|---|---|---|
| 连接 | 线性权重 | 可学习一元函数 |
| 节点 | 加权和 + 激活 | 求和 |
| 直觉 | 调积木大小 | 弯折连接曲线 |
为什么被吹成“下一个 MLP”?一是表示定理给理论背书;二是边函数可画,似乎能看出变量如何影响输出;三是在低维拟合、符号回归中,可能用较少参数得到干净结果。科学发现、小数据建模很吃这套。
为什么没普及?第一,算得贵:每条边都要算曲线并在多个基函数上求值,显存和计算量易膨胀。第二,不好做大:MLP 的矩阵乘法被 GPU 优化到极致,KAN 的样条求值更难高效并行,堆到 Transformer(变换器)规模不划算。第三,理论不等于可学习:定理保证“存在”,不保证梯度下降找得到,也不保证泛化。第四,可解释性常被高估:边函数能画,不等于人能读懂,多层叠加后更难。第五,生态差:MLP 有成熟框架、算子库、调参经验和 Scaling Law(缩放规律),KAN 缺这些基础设施。
对从业者:把 KAN 当特殊场景工具,而非默认骨干。低维科学数据、符号回归、看变量影响时值得试;大规模视觉、语言模型仍用 MLP/Transformer 更现实。对普通人:架构创新被热炒不等于会替代主流,胜负常取决于训练成本、工程生态和规模化能力。
