跳到主内容
快讯直播
AI智模界
AI 词典

反向传播(Backpropagation):模型“学会了”背后到底发生了什么

反向传播(Backpropagation)是训练神经网络时,用来计算“每个参数该为最终误差负多少责任”的算法。

想象一条工厂流水线:原料从第一道工序走到最后一道工序,最后得到一个产品,这叫前向传播(Forward Propagation)。产品拿去质检,和标准答案一比,得到误差分数,这个打分规则叫损失函数(Loss Function)。现在要改进产品,但流水线上有成千上万个旋钮——也就是模型参数——该拧哪个、拧多少?反向传播就是倒着走一遍流水线,问每个旋钮:“你稍微变一点,最终误差会变多少?”这个“变化率”就是梯度(Gradient)。它利用链式法则(Chain Rule),把最后一层的误差影响一层层传回前面。

打个比方:总装车间发现产品不合格,先问最后一颗螺丝“你松一点,质量分下降多少”,再问上一道工序“你给的零件偏差,会让这颗螺丝的影响放大还是缩小”。一路倒推,每个环节都知道自己该负多少责任。

拿到梯度后,真正去拧旋钮的是优化器(Optimizer),例如梯度下降(Gradient Descent):新参数 = 旧参数 - 学习率 × 梯度。所以“模型学会了”数学上就是:反复做“前向算误差、反向算梯度、更新参数”,直到损失下降、预测更接近目标。它并不是像人一样理解了概念,而是把大量参数调到一组让误差更小的数值。

概念干什么
前向传播输入到输出,算预测
损失函数预测和目标差多少
反向传播从损失倒推每个参数的梯度
梯度下降按梯度真正更新参数

区别在于:前向传播负责“算答案”,反向传播负责“算责任”,梯度下降负责“改参数”。反向传播本身不更新参数,只是高效求出梯度;没有它,逐个参数试错会慢到不可行。

对从业者,理解它能解释梯度消失、梯度爆炸、学习率、batch size 等现象;对普通人,它说明大模型能力来自数据、目标和大量参数调优,不是凭空“背答案”。具体框架的实现细节以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。