循环深度指的是:模型的层数不再等于它的思考深度。同一组 Transformer 层在前向计算中被反复执行多遍,用迭代轮数换出等效的网络深度。
原理
常规 Transformer 的深度是个静态数字:堆了 N 层就是 N 层,每层有自己的参数,信息从第一层单向前进到最后一层,走一遍就出结果,深度等于层数。
循环深度换了个做法:中间只放一小段共享参数的层,比如 2 层,但把它跑 8 遍。从信息走过的路径看,它像一个 16 层网络;从参数量看,它仍然只是一个 2 层网络。
打个比方:普通深度像是把一份文件传给 16 个不同的同事接力修改,每人有自己的专长和笔迹(各自的参数)。循环深度像是只有 2 个同事,文件在他们手上来回传 8 轮,每轮接着上一轮的结果继续改。文件被修改的总次数差不多,但需要雇的人少得多。
和相邻概念的区别
| 维度 | 普通堆叠 Transformer | 循环深度 Transformer |
|---|---|---|
| 深度来源 | 层数,层与层各不相同 | 层数 × 迭代轮数,层参数共享 |
| 参数量 | 随深度线性增长 | 与迭代轮数无关 |
| 计算量 | 一次前向走一遍 | 一遍或多遍,轮数可固定也可自适应 |
| 直觉 | 更多人接力 | 同一个人多想几遍 |
再区分三个近邻:
- 循环神经网络(RNN):RNN 沿序列方向循环,状态逐步递推;循环深度是在“层”的方向上迭代,注意力仍在序列维度上做全局交互。
- 思维链(AI 词典:Chain-of-Thought">Chain-of-Thought):CoT 把中间思考写成显式 token,外界看得见;循环深度在隐藏状态里多迭代,不产出中间文字,可以理解为一种“隐式思考”。
- 混合专家(MoE)等稀疏化路线:稀疏化是按输入决定激活哪部分参数,循环深度是同一组参数被反复使用,方向几乎相反。
对从业者与普通人的意义
对从业者,循环深度是一种重新分配预算的思路:把参数预算换成计算预算。在显存吃紧、参数量受限(端侧设备、单卡训练)的场景里,用共享层换来等效深度是相对划算的选择。代价也明确:迭代天然串行,延迟变高;梯度在反复回传中容易不稳,通常要配合中间层监督、随机迭代轮数等训练技巧。另外,“深度”这个指标要和“参数量”分开看,比较模型时不能再只数层数。
对普通人,它提示了一件反直觉的事:模型变聪明未必只靠变大。同一个模型多想几轮,也可能答得更准——就像让人做难题时别抢答,先在心里推演两遍再开口。
