研究站点 qlabs.sh 上线了一个名为 Dust 的论文页面,标题为 Pretraining Transformers Without AI 词典:Backpropagation">Backpropagation,即尝试在不使用反向传播的前提下完成 Transformer 的预训练。该条目目前归类为论文,具体方法、实验设置与结果需查阅原文链接。
反向传播是当下深度学习训练的事实标准:它依据链式法则把损失梯度逐层回传,用以更新参数。但这一机制长期伴随两个争议。工程上,反向计算需要保留前向阶段的中间激活,显存占用随模型深度与序列长度增长,成为大模型训练的瓶颈之一;理论层面,反向传播依赖全局误差信号与权重对称性,与生物神经系统的学习方式差异明显。
为此,研究者提出过多种替代路线,包括前向-前向算法、零阶或无梯度优化、局部学习规则等。它们在小型任务上偶有进展,但要扩展到 Transformer 预训练这种参数量大、序列长、对优化稳定性要求高的场景,仍受制于收敛速度、精度与算力效率。
Dust 的标题把目标直接指向“预训练”环节,而非仅做微调或小型基准验证。如果这类方法能在大规模 Transformer 上稳定工作,可能影响训练显存估算、并行与通信策略的设计,也会让人重新审视“必须依赖反向传播”这一默认假设。上述影响最终取决于论文给出的方案与证据,建议以原文为准。
