一句话定义
机械可解释性(Mechanistic Interpretability)是想把神经网络的内部计算——比如 Transformer 的注意力头(attention head)、MLP 层,以及它们之间流动的信息——拆成一张人能看懂的“电路图”,并用干预实验验证每个部件到底在算什么。
先打个比方
把大模型当成一栋楼。行为评测(behavioral evaluation)是站在楼外看灯光:给什么输入、出什么结果,里面靠猜。可解释性(interpretability)这个大类是拿到楼层平面图。机械可解释性更狠,它要画的是电线走向图:哪根线接到哪个开关,按下哪个开关哪盏灯会亮——而且这张图必须能被实验证伪。
核心零件:传送带、搬运工和加工台
Transformer 内部可以粗分成三样东西:
- 残差流(residual stream):一条从左到右的公共传送带,每层往里加信息,也随时能读走信息。
- 注意力头(attention head):搬运工。它用当前位置的查询(query)去和其他位置的键(key)比对,再按匹配程度把对应的值(value)搬到传送带上。
- MLP 层:加工台,对传送带上的向量做非线性变换。
一个“回路”(circuit)就是若干注意力头和 MLP 组成的小组,合伙干一件具体的活。常被提到的例子是归纳头(induction head):模型看到重复片段时,一个头负责找出“上次这个 token 后面跟的是什么”,另一个头负责把那个答案复制过来,于是模型能接上重复的序列。这类结构不是人设计的,是训练中自己长出来的。
还有一个绕不开的现象叫叠加(superposition):模型维度不够用,就把很多“特征”(feature)挤进同一批神经元,所以单个神经元往往含义不纯。常见对策是训练AI 词典:稀疏自编码器">稀疏自编码器(sparse autoencoder),把叠在一起的特征重新摊开成一组稀疏、可命名的方向。
怎么才算“看懂了”
光有漂亮的图不算数,得做干预:把某个注意力头或某条激活通道关掉、替换、放大(activation patching),看输出是否按预期变化。能预测干预后的结果,才算真读懂了这一段计算。
和相邻概念的区别
| 方向 | 目标 | 产出 | 验证方式 |
|---|---|---|---|
| 行为评测 | 知道模型表现如何 | 分数、错误样本 | 只看输入输出 |
| 事后解释(如显著性图 saliency map) | 给输出配一个理由 | 热力图、重要度 | 多为相关性 |
| 机械可解释性 | 搞清内部算法 | 回路图、特征字典 | 靠干预实验验证 |
对从业者和普通人的意义
从业者:调试时,模型在某类格式下崩掉,可能直接定位到具体回路,而不是盲试提示词;做安全评估时,“某种行为背后有没有专门回路”是比答题分数更硬的证据;反过来,常见的回路模式也可能影响架构和训练设计。
普通人:短期内不会让你自己看电路图,但会改变两件事。一是模型出错时,解释可能从“它就是这么说”变成“这个回路在什么条件下被触发”。二是监管和评测会更看重内部证据,而不只是刷分。
这个领域还在早期,很多结论只在小模型或特定任务上验证过,离“整张大模型的完整电路图”还很远。具体方法与最新进展,以官方页面和原始论文为准。
