一句话定义:Native Sparse Attention(原生稀疏注意力,简称 NSA)是一种在预训练阶段就把"每个词只需要看一小部分词"固化进结构的注意力机制,而不是等模型训完、再在推理时临时把注意力剪掉。
注意力的成本随文本长度平方增长:上下文从几千字涨到几十万字,开销可能翻上千倍。全注意力要求每个词回看前面所有词,而其中绝大多数回看其实是浪费。
打个比方。1000 人的大会,全注意力相当于每个人先听完所有人的每一句话再总结;NSA 的做法是:先翻一页会议纪要(压缩分支,把连续多个词压成一块摘要,快速掌握全局),再挑三五段最相关的发言精读(选择分支,按块打分,只保留最相关的若干块),同时听着身边人刚说的话(滑窗分支,保住局部语序)。三条分支的结果再由可学习的门控加权合并。
"原生"有两层意思:一是稀疏模式参与训练,梯度能传回选块逻辑和门控,模型是"从小用稀疏、学会了怎么用";二是训练与推理共用同一套稀疏结构,不存在训练时用全注意力、上线时换成近似版本的错位。
| 做法 | 稀疏何时发生 | 特点 |
|---|---|---|
| 全注意力 | 不稀疏 | 效果稳,长文本成本高 |
| 推理期稀疏(KV 淘汰、剪枝等) | 训练之后 | 免训练、上手快,但属于近似,长文容易掉点 |
| 原生稀疏 NSA | 预训练起 | 稀疏是结构的一部分,训练推理一致 |
它和 MoH(Mixture-of-Heads,混合注意力头)可以叠加:NSA 稀疏的是"看哪些位置的词",MoH 稀疏的是"这次激活哪几个注意力头",一个管词维度、一个管头维度,思路都接近 MoE 只激活部分专家。两者组合,等于在两个维度上同时省算力。
对从业者来说,意义在于长上下文不必只靠全注意力硬扛,稀疏从"精度换速度的权宜之计"变成一种正常的架构选项;对普通人来说,则是更长的文档处理能力和更便宜的"长期记忆"类应用。具体效果与实现细节,以原论文和官方仓库为准。
