跳到主内容
快讯直播
AI智模界
AI 词典

因果追踪:把模型敲坏再修好,就知道知识藏在哪

一句话说清:因果追踪(Causal Tracing)就是先把模型内部弄坏、再一块块修回来,看修好哪一块能让答案恢复,从而定位某条事实知识究竟藏在哪一层、哪个位置。

它是怎么做的

拿 GPT 这类自回归语言模型举例。给它半句话:"埃菲尔铁塔位于",它接上"巴黎"。这一步叫干净运行(clean run),同时记下网络每一层、每一个 token 位置上的激活值(activation)。

接下来做两步操作。

第一步是破坏:在某个位置往激活里注入噪声,让模型答错,比如答成"罗马"。相当于砸掉一个零件。

第二步是恢复:把干净运行中某一层的激活原样贴回被破坏的那次运行,看答案能不能被救回来。

把"破坏—恢复"的组合在所有层、所有位置上跑一遍,就得到一张热力图:哪些地方一恢复,答案就回来了。

打个比方

公司里有个人知道某个事实,你想找出是谁。做法是:先把所有人的嘴全堵上,公司立刻答不上来;然后挨个松开某一个人的嘴,看谁一开口答案就回到位。那个人就是这条知识的关键节点。因果追踪干的就是这件事——只不过"嘴"是激活值,"松开"是把干净激活贴回去。

结论是什么

这类研究普遍发现:模型回忆事实时,关键节点集中在中间层,位置靠近主语(subject)的最后一个 token,而且主要落在多层感知机(MLP,Multi-Layer Perceptron)模块上,而非注意力(attention)模块。这也解释了一个反直觉的现象:想给模型改一个事实,不必重训整个网络,动那一小块就可能有效——ROME 一类的知识编辑方法正是由此而来。

和相邻概念的区别

方法它在问什么逻辑类型
注意力可视化、梯度归因哪里激活大、哪里对输出影响大相关性
探针(Probing)某层激活里能不能"读出"某信息相关性(读得出不等于用得上)
因果追踪拿掉它、换回它,输出会不会变因果
知识编辑(如 ROME)定位之后动手改应用

对你有什么用

做可解释性、幻觉治理、知识更新的从业者,因果追踪是"先定位、再动手"的前提——盲目全参数微调既贵,又容易伤到其他能力。对普通职场人,它给的是一个通用思路:想知道复杂系统里哪部分是关键,光看它"很活跃"不够,得真的把它关掉试试。这条思路放到流程梳理、组织诊断、代码排查上都成立。

需要提醒的是,因果追踪定位的是"某次前向计算中被调用的关键节点",并不等于"知识就明明白白存在那个神经元里",后续研究对结论的粒度仍有讨论。具体实现和最新进展,以原始论文与官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。