跳到主内容
快讯直播
AI智模界
AI 词典

注意力汇聚(Attention Sink):模型为什么总盯着第一个 token

一句话定义:注意力汇聚(Attention Sink)指在 Transformer 模型中,许多注意力头会把相当大比例的注意力权重分配给序列最前面的那个 token——常见是 BOS(Beginning of Sequence)或第一个 token——哪怕它和当前要预测的内容没有直接语义关系。

它怎么发生的

自注意力(Self-Attention)里,每个 token 会算出一组注意力分数,再经过 softmax 归一化,让所有分数加起来等于 1。也就是说,模型不能“弃权”,必须把注意力票投出去。当当前 token 没有明确想关注的语义对象时,它就需要一个默认的“回收站”。

序列第一个 token 往往是最方便的回收站:它位置固定,在因果掩码(Causal Mask)下对所有后续 token 都可见,而且常常本身没什么具体语义。于是,大量“不知道投给谁”的票就流向它。

打个比方:开会时规定每个人必须投票,不能弃权。当没有明确候选人时,大家就把票投给门口那把空椅子。椅子票数最高,不代表它最重要,只代表票必须有个去处。

和相邻概念的区别

概念关注什么典型表现
注意力汇聚默认、无明确语义目标的注意力去处第一个 token 获得异常高的权重
语义注意力与当前任务真正相关的内容指代消解时关注前文实体,翻译时关注对应词
KV Cache 淘汰推理时省显存、保哪些历史状态滑动窗口只保留最近若干 token

所以,注意力汇聚不是“模型最重视开头”,也不是普通的缓存淘汰策略。它更像是 softmax 机制下的一种结构性副产物。

对流式长上下文为什么关键

流式生成或超长上下文推理中,常见做法是滑动窗口:只保留最近一段 token 的 KV Cache(Key-Value Cache)。但如果把最前面的 token 全丢掉,模型就失去了那个默认接收器,注意力被迫挤到语义内容上,分布容易乱掉,输出可能变得不稳定、重复或胡言乱语。

因此,一些流式长上下文方案会额外保留最前面几个 token 的 KV,再配合最近窗口。这样成本很低,却能给模型一个稳定的“空椅子”。

对从业者和普通人的意义

做长上下文、KV Cache 压缩、token 淘汰时,不要一刀切地把开头删掉;保留少量初始 token 往往是性价比很高的保险。写提示词时,系统提示或对话开头的锚点作用也可能比想象中更强。看注意力热力图时,第一个 token 高分不必过度解读为“模型最在意开头”。

具体实现细节和参数,以官方文档或论文页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。