一句话: 叠加(Superposition)指的是神经网络里一层只有几百个神经元,却要表示成千上万个特征(feature),于是它把多个特征"塞"进方向略有重叠的向量里,一个神经元因此同时参与表达好几件事。
为什么能塞得下
先建立一个直觉:在二维平面上,最多只有两个互相垂直的方向;但维度一高,能放下的"几乎互相垂直"的方向数量会急剧膨胀。每多一个维度,可容纳的近正交方向并不是加一,而是成倍增长。所以一千个神经元组成的空间里,理论上可以放下远远多于一千个彼此"基本不打架"的方向。
这就像一栋楼里的房间号:如果每条走廊只能标一个房间,房间就很快用完;但允许编号稍微靠近,比如 3A 和 3A′,你就能在同样的走廊里排下更多门牌。代价是有人可能敲错门——术语叫干扰(interference)。
稀疏让它划算
如果每个特征都天天同时激活,互相干扰会乱成一锅粥,模型宁可不这么干。但真实数据里,一个特征往往只在少数样本上被触发(比如"提到发票"这种特征,大多数句子里都不出现),这就是稀疏性(sparsity)。特征越稀疏,"撞车"的概率越低,用少量维度表示大量特征就越划算。叠加和稀疏,基本是一对搭档。
和"分布式表示"不是一回事
| 分布式表示(distributed representation) | 叠加(superposition) | |
|---|---|---|
| 谁在表示一个概念 | 多个神经元共同表示 | 多个不相关的特征共用同一批神经元 |
| 单个神经元 | 可以比较专一 | 常常是"多义"的,激活了也说不清是什么 |
| 关注点 | 信息分散在群体里 | 维度不够,被迫压缩 |
一个典型佐证是多义神经元(polysemantic neuron):你在模型里找到一个神经元,它对"代码缩进"敏感,又对"法律条文引用"敏感,看起来毫无关联——它不是学坏了,而是这两类特征恰好被分配到了同一方向附近。
对做事的实际意义
- 别指望单个神经元能解释清楚。 直接看激活值做归因,往往会得出自相矛盾的结论,因为一个方向叠加了多个特征。
- 拆解要靠字典学习。 像AI 词典:稀疏自编码器">稀疏自编码器(sparse autoencoder)这类方法,就是假设"真正的特征是稀疏的、被叠加编码了",把激活反向还原成一组更干净的特征方向。这是目前可解释性研究的一条主线。
- 改动会连带伤到别处。 剪枝、量化、微调某个内部方向时,影响往往不止一个能力,因为那个方向上叠着好几个特征。
一句话记住:模型不是没记住那么多特征,而是把特征挤在了有限的维度里,用干扰换容量。
