跳到主内容
快讯直播
AI智模界
AI 词典

激活函数(Activation Function):给神经网络装上非线性开关

一句话定义:激活函数是神经网络里每个神经元在加权求和之后、把结果“掰弯”一下再传给下一层的那道函数。

先说为什么非要它。一层神经网络做的事是“加权求和”,本质是个线性变换。如果层与层之间不加任何东西,把十个线性变换串起来,数学上等价于一个大线性变换——网络再深也只会画直线,识别不了“异或”这种弯弯曲曲的关系。激活函数的作用,就是在这条直线上拧出一道弯。

打个比方:线性层像水管上的比例阀,进来多少水就按倍数放大或缩小,整条管路怎么串还是按比例走。激活函数则是装在每节管子后面的闸门,有的水小到一定程度就干脆不放,有的则慢慢开、平滑过渡。有了这种“不按比例来”的关卡,整条管路才会表现出复杂行为。

几种常见闸门:

函数形状负区间表现特点
Sigmoid / TanhS 形、平滑两侧饱和,梯度趋近 0早期常用,深层网络易梯度消失
ReLU负数归零、正数直通恒为 0,梯度为 0便宜、稀疏;可能“神经元死亡”
GELU平滑的 ReLU 近似有小幅负值训练更稳,计算略贵
SiLU / Swish平滑、非单调有小幅负值平滑可导,常与 GELU 一起被比较

所谓“神经元死亡”,是 ReLU 最典型的坑:某个神经元的权重一旦被推到让输出长期为负,它的梯度就永远是 0,参数再也收不到更新信号,这个神经元就彻底“躺平”,对网络不再有贡献。学习率设得太大、初始化不合适时,可能一次就死掉一大片。GELU 和 SiLU 在负区间保留了一个很小但非零的斜率,等于给躺平的神经元留了条缝,训练更稳,代价是多一点计算量。

和相邻概念的区别:激活函数是逐元素作用的非线性,不改变张量形状;权重做的是线性混合;归一化层(如 BatchNorm、AI 词典:LayerNorm">LayerNorm)调整的是数值分布,不提供非线性;Softmax 通常只出现在输出层,把一组分数变成概率分布,一般不算作隐藏层的激活。

实际意义:对从业者,选激活函数是搭网络时最早的几个决定之一——很多卷积网络默认 ReLU 起步,Transformer 类结构里 GELU 及其变体很常见;训练不收敛、loss 卡住时,激活函数是值得排查的一环,但别指望它救回糟糕的数据或学习率。对普通职场人,可以这么理解:模型能不能学会“拐弯”,靠的就是这一层薄薄的开关——它不起眼,却决定了网络是灵活的曲线还是死板的直线。具体某个框架默认用哪个、有哪些新变体,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。