一句话定义:跨层转码器(Cross-Layer Transcoder,CLT)是一种可解释性工具,它把大模型某一层的激活拆成一组稀疏特征,并让同一个特征能被跨越多层地追踪,而不只是解释它所在的那一层。
先看它要解决什么问题。大模型内部有一条"残差流"(residual stream),每层往上面加一点东西。想讲清"第 5 层的一个概念怎么影响到第 20 层的输出",主流工具是AI 词典:稀疏自编码器">稀疏自编码器(Sparse Autoencoder,SAE):输入某一层的激活,压成几百个稀疏特征再重建回来,于是你能读出"这层在讲法律""这里有个否定"。
但 SAE 是逐层独立训练的。第 5 层有个"法律"特征,第 6 层可能也有,可方向和尺度都不一样,是两个不同的向量。你没法直接说"是第 5 层这个特征引起了第 6 层那个特征"。手里一堆散落各层的标签,却拼不出电路。
跨层转码器换了目标。普通转码器(Transcoder)不重建本层输入,而是预测某个子层(通常是 MLP,多层感知机块)的输出,直接学"这一块在干什么"。跨层转码器再进一步:编码器读第 ℓ 层的残差流,解码器同时给出它对第 ℓ 层及之后若干层 MLP 输出的贡献。特征的名字只写一次,却能记录它在好几层各加了什么。
打个比方:车间流水线上每站都拍照。SAE 相当于每站各配一名质检员,各自给零件起名——第 3 站的"红色圆盘"和第 4 站的"朱红圆片"其实是同一个零件,但没人知道。跨层转码器相当于给每个零件贴一张全程唯一编号的标签,并记录它在每一站往产品里加了什么。于是你能顺着编号画出从前到后的因果图(attribution graph)。
| 方法 | 学什么 | 特征作用范围 | 能否直接连线 |
|---|---|---|---|
| SAE | 重建同一层激活 | 单层 | 不能,需事后匹配 |
| 转码器 | 预测某个子层输出 | 单层 | 局部可以 |
| 跨层转码器 | 预测多个后层的 MLP 输出贡献 | 跨层 | 可以,天然成图 |
补一句:注意力(attention)子层通常不交给转码器,而是另行近似处理,具体做法以论文和官方文档为准。
意义有两层。对研究者,"特征"从静态词典变成可追踪的实体,"模型为什么这么说"有了证据链,能顺着图去看某段能力、某次幻觉是从哪几层冒出来的。对普通职场人,它更像一个心理模型:模型不是一整块黑箱,而是许多薄薄的、可命名的步骤叠出来的;跨层转码器给的就是"同一件事从第几层传到第几层"的地图。
局限也要说清:归因图是近似出来的假设,不是模型计算的录像;特征仍可能多义;重建有误差,顺着图找到的因果链还需要实验验证。别把一张漂亮的图当成定论。
