跳到主内容
快讯直播
AI智模界
AI 词典

机械可解释性(Mechanistic Interpretability):把大模型的黑箱拆成一张电路图

一句话定义

机械可解释性(Mechanistic Interpretability)是想把神经网络的内部计算——比如 Transformer 的注意力头(attention head)、MLP 层,以及它们之间流动的信息——拆成一张人能看懂的“电路图”,并用干预实验验证每个部件到底在算什么。

先打个比方

把大模型当成一栋楼。行为评测(behavioral evaluation)是站在楼外看灯光:给什么输入、出什么结果,里面靠猜。可解释性(interpretability)这个大类是拿到楼层平面图。机械可解释性更狠,它要画的是电线走向图:哪根线接到哪个开关,按下哪个开关哪盏灯会亮——而且这张图必须能被实验证伪。

核心零件:传送带、搬运工和加工台

Transformer 内部可以粗分成三样东西:

  • 残差流(residual stream):一条从左到右的公共传送带,每层往里加信息,也随时能读走信息。
  • 注意力头(attention head):搬运工。它用当前位置的查询(query)去和其他位置的键(key)比对,再按匹配程度把对应的值(value)搬到传送带上。
  • MLP 层:加工台,对传送带上的向量做非线性变换。

一个“回路”(circuit)就是若干注意力头和 MLP 组成的小组,合伙干一件具体的活。常被提到的例子是归纳头(induction head):模型看到重复片段时,一个头负责找出“上次这个 token 后面跟的是什么”,另一个头负责把那个答案复制过来,于是模型能接上重复的序列。这类结构不是人设计的,是训练中自己长出来的。

还有一个绕不开的现象叫叠加(superposition):模型维度不够用,就把很多“特征”(feature)挤进同一批神经元,所以单个神经元往往含义不纯。常见对策是训练AI 词典:稀疏自编码器">稀疏自编码器(sparse autoencoder),把叠在一起的特征重新摊开成一组稀疏、可命名的方向。

怎么才算“看懂了”

光有漂亮的图不算数,得做干预:把某个注意力头或某条激活通道关掉、替换、放大(activation patching),看输出是否按预期变化。能预测干预后的结果,才算真读懂了这一段计算。

和相邻概念的区别

方向目标产出验证方式
行为评测知道模型表现如何分数、错误样本只看输入输出
事后解释(如显著性图 saliency map)给输出配一个理由热力图、重要度多为相关性
机械可解释性搞清内部算法回路图、特征字典靠干预实验验证

对从业者和普通人的意义

从业者:调试时,模型在某类格式下崩掉,可能直接定位到具体回路,而不是盲试提示词;做安全评估时,“某种行为背后有没有专门回路”是比答题分数更硬的证据;反过来,常见的回路模式也可能影响架构和训练设计。

普通人:短期内不会让你自己看电路图,但会改变两件事。一是模型出错时,解释可能从“它就是这么说”变成“这个回路在什么条件下被触发”。二是监管和评测会更看重内部证据,而不只是刷分。

这个领域还在早期,很多结论只在小模型或特定任务上验证过,离“整张大模型的完整电路图”还很远。具体方法与最新进展,以官方页面和原始论文为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。