跳到主内容
快讯直播
AI智模界
AI 词典

跨层转码器:给每个特征发一张全程通行证

一句话定义:跨层转码器(Cross-Layer Transcoder,CLT)是一种可解释性工具,它把大模型某一层的激活拆成一组稀疏特征,并让同一个特征能被跨越多层地追踪,而不只是解释它所在的那一层。

先看它要解决什么问题。大模型内部有一条"残差流"(residual stream),每层往上面加一点东西。想讲清"第 5 层的一个概念怎么影响到第 20 层的输出",主流工具是AI 词典:稀疏自编码器">稀疏自编码器(Sparse Autoencoder,SAE):输入某一层的激活,压成几百个稀疏特征再重建回来,于是你能读出"这层在讲法律""这里有个否定"。

但 SAE 是逐层独立训练的。第 5 层有个"法律"特征,第 6 层可能也有,可方向和尺度都不一样,是两个不同的向量。你没法直接说"是第 5 层这个特征引起了第 6 层那个特征"。手里一堆散落各层的标签,却拼不出电路。

跨层转码器换了目标。普通转码器(Transcoder)不重建本层输入,而是预测某个子层(通常是 MLP,多层感知机块)的输出,直接学"这一块在干什么"。跨层转码器再进一步:编码器读第 ℓ 层的残差流,解码器同时给出它对第 ℓ 层及之后若干层 MLP 输出的贡献。特征的名字只写一次,却能记录它在好几层各加了什么。

打个比方:车间流水线上每站都拍照。SAE 相当于每站各配一名质检员,各自给零件起名——第 3 站的"红色圆盘"和第 4 站的"朱红圆片"其实是同一个零件,但没人知道。跨层转码器相当于给每个零件贴一张全程唯一编号的标签,并记录它在每一站往产品里加了什么。于是你能顺着编号画出从前到后的因果图(attribution graph)。

方法学什么特征作用范围能否直接连线
SAE重建同一层激活单层不能,需事后匹配
转码器预测某个子层输出单层局部可以
跨层转码器预测多个后层的 MLP 输出贡献跨层可以,天然成图

补一句:注意力(attention)子层通常不交给转码器,而是另行近似处理,具体做法以论文和官方文档为准。

意义有两层。对研究者,"特征"从静态词典变成可追踪的实体,"模型为什么这么说"有了证据链,能顺着图去看某段能力、某次幻觉是从哪几层冒出来的。对普通职场人,它更像一个心理模型:模型不是一整块黑箱,而是许多薄薄的、可命名的步骤叠出来的;跨层转码器给的就是"同一件事从第几层传到第几层"的地图。

局限也要说清:归因图是近似出来的假设,不是模型计算的录像;特征仍可能多义;重建有误差,顺着图找到的因果链还需要实验验证。别把一张漂亮的图当成定论。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。