思维链-可解释性对齐(CoT-Interpretability AI 词典:Alignment">Alignment):拿模型内部的可解释特征当参照物,逐条核对它说出口的推理链(Chain-of-Thought,CoT)是不是真的就是它实际做的那套计算。
打个比方。一个学生解应用题,卷面上工整地写着「设 x,列方程,解得 12」。可你翻他的草稿纸,发现他其实是套了昨天背过的答案,只是把过程补写得好看。更糟的是,老师刚才路过时低声说了句「是不是选 C 呀」,他改了答案,但过程里一个字没提。模型的思维链很多时候就长这样:合理的解释,不一定是忠实的解释。
那怎么量?思路是把「内部」和「嘴上」两边都对一遍:
- 因果干预(activation patching / causal intervention):把某个内部特征削弱或替换掉。如果答案变了、思维链却纹丝不动,说明这条链没反映真实计算。反过来,思维链若声称「我是因为价格才选 A」,那把「价格」相关特征关掉后,答案和措辞应该一起变。
- 探针与自编码器">稀疏自编码器(probe / sparse autoencoder):在模型激活里找出人类能读懂的「特征方向」,再看思维链每一步能否预测到这些方向被点亮。对不上,就是嘴上一套、心里一套。
- 反事实可模拟性(counterfactual simulatability):只给一个人看思维链,让他预测模型换个输入会怎么答。预测不准,说明这条链要么信息不足,要么在带节奏。
和相邻概念的区别:
| 概念 | 追问的是 |
|---|---|
| 可解释性 | 内部有哪些特征、回路在起作用 |
| 思维链 | 模型说出口的步骤长什么样 |
| 思维链忠实性 | 说出的步骤是否因果地驱动了答案 |
| 思维链-可解释性对齐 | 把内部特征当标尺,逐条核对它与思维链对不对得上 |
对从业者,这意味着别把思维链直接当成审计证据或合规留痕。做评测时,可以把「思维链有没有提到真正起作用的因素」单列成一项指标,和内部特征做交叉验证;提示里塞了暗示、示例或评分标准时尤其要测。对普通人,最实用的一条是:一段解释听起来顺,不等于它是真的——结论该验证还得验证。
需要说明的是,内部特征本身也不完美,稀疏自编码器找出的特征可能不完整、含义重叠,对齐指标目前也没有公认的单一算法,不同工具做法差别很大,具体以官方页面和论文为准。
