跳到主内容
快讯直播
AI智模界
AI 词典

叠加(Superposition):一个神经元为什么身兼数职

一句话: 叠加(Superposition)指的是神经网络里一层只有几百个神经元,却要表示成千上万个特征(feature),于是它把多个特征"塞"进方向略有重叠的向量里,一个神经元因此同时参与表达好几件事。

为什么能塞得下

先建立一个直觉:在二维平面上,最多只有两个互相垂直的方向;但维度一高,能放下的"几乎互相垂直"的方向数量会急剧膨胀。每多一个维度,可容纳的近正交方向并不是加一,而是成倍增长。所以一千个神经元组成的空间里,理论上可以放下远远多于一千个彼此"基本不打架"的方向。

这就像一栋楼里的房间号:如果每条走廊只能标一个房间,房间就很快用完;但允许编号稍微靠近,比如 3A 和 3A′,你就能在同样的走廊里排下更多门牌。代价是有人可能敲错门——术语叫干扰(interference)

稀疏让它划算

如果每个特征都天天同时激活,互相干扰会乱成一锅粥,模型宁可不这么干。但真实数据里,一个特征往往只在少数样本上被触发(比如"提到发票"这种特征,大多数句子里都不出现),这就是稀疏性(sparsity)。特征越稀疏,"撞车"的概率越低,用少量维度表示大量特征就越划算。叠加和稀疏,基本是一对搭档。

和"分布式表示"不是一回事

分布式表示(distributed representation)叠加(superposition)
谁在表示一个概念多个神经元共同表示多个不相关的特征共用同一批神经元
单个神经元可以比较专一常常是"多义"的,激活了也说不清是什么
关注点信息分散在群体里维度不够,被迫压缩

一个典型佐证是多义神经元(polysemantic neuron):你在模型里找到一个神经元,它对"代码缩进"敏感,又对"法律条文引用"敏感,看起来毫无关联——它不是学坏了,而是这两类特征恰好被分配到了同一方向附近。

对做事的实际意义

  • 别指望单个神经元能解释清楚。 直接看激活值做归因,往往会得出自相矛盾的结论,因为一个方向叠加了多个特征。
  • 拆解要靠字典学习。AI 词典:稀疏自编码器">稀疏自编码器(sparse autoencoder)这类方法,就是假设"真正的特征是稀疏的、被叠加编码了",把激活反向还原成一组更干净的特征方向。这是目前可解释性研究的一条主线。
  • 改动会连带伤到别处。 剪枝、量化微调某个内部方向时,影响往往不止一个能力,因为那个方向上叠着好几个特征。

一句话记住:模型不是没记住那么多特征,而是把特征挤在了有限的维度里,用干扰换容量。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。