跳到主内容
快讯直播
AI智模界
AI 词典

循环深度(Looped Transformer)

循环深度指的是:模型的层数不再等于它的思考深度。同一组 Transformer 层在前向计算中被反复执行多遍,用迭代轮数换出等效的网络深度。

原理

常规 Transformer 的深度是个静态数字:堆了 N 层就是 N 层,每层有自己的参数,信息从第一层单向前进到最后一层,走一遍就出结果,深度等于层数。

循环深度换了个做法:中间只放一小段共享参数的层,比如 2 层,但把它跑 8 遍。从信息走过的路径看,它像一个 16 层网络;从参数量看,它仍然只是一个 2 层网络。

打个比方:普通深度像是把一份文件传给 16 个不同的同事接力修改,每人有自己的专长和笔迹(各自的参数)。循环深度像是只有 2 个同事,文件在他们手上来回传 8 轮,每轮接着上一轮的结果继续改。文件被修改的总次数差不多,但需要雇的人少得多。

和相邻概念的区别

维度普通堆叠 Transformer循环深度 Transformer
深度来源层数,层与层各不相同层数 × 迭代轮数,层参数共享
参数量随深度线性增长与迭代轮数无关
计算量一次前向走一遍一遍或多遍,轮数可固定也可自适应
直觉更多人接力同一个人多想几遍

再区分三个近邻:

  • 循环神经网络(RNN):RNN 沿序列方向循环,状态逐步递推;循环深度是在“层”的方向上迭代,注意力仍在序列维度上做全局交互。
  • 思维链(AI 词典:Chain-of-Thought">Chain-of-Thought):CoT 把中间思考写成显式 token,外界看得见;循环深度在隐藏状态里多迭代,不产出中间文字,可以理解为一种“隐式思考”。
  • 混合专家(MoE)等稀疏化路线:稀疏化是按输入决定激活哪部分参数,循环深度是同一组参数被反复使用,方向几乎相反。

对从业者与普通人的意义

对从业者,循环深度是一种重新分配预算的思路:把参数预算换成计算预算。在显存吃紧、参数量受限(端侧设备、单卡训练)的场景里,用共享层换来等效深度是相对划算的选择。代价也明确:迭代天然串行,延迟变高;梯度在反复回传中容易不稳,通常要配合中间层监督、随机迭代轮数等训练技巧。另外,“深度”这个指标要和“参数量”分开看,比较模型时不能再只数层数。

对普通人,它提示了一件反直觉的事:模型变聪明未必只靠变大。同一个模型多想几轮,也可能答得更准——就像让人做难题时别抢答,先在心里推演两遍再开口。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。