跳到主内容
快讯直播
AI智模界
AI 词典

自注意力机制(Self-Attention):Q、K、V 到底在算什么

一句话定义:自注意力机制(Self-Attention)让序列中的每个位置,直接和同一序列里的所有位置"对一遍眼",再按相关程度把信息加权汇总到自己身上。

一个会议室的比方

想象一场所有人同时发言的会议。每人手里有一张纸条,写着"我现在想找什么"——这是 Query(查询,Q);胸前挂着一块牌子,写着"我是谁、我能提供什么"——这是 Key(键,K);脑子里装着"我实际能交出的内容"——这是 Value(值,V)。

规则是:每人拿自己的 Q,去和在场所有人的 K 逐一比对,得到一个分数,分数越高说明对方越对胃口。把分数归一化(softmax)成一组权重,再用这组权重加权求和所有人的 V,就得到这个人这一轮的"新认知"。全场没有先后顺序,一次算完。

写成矩阵就是 Attention(Q, K, V) = softmax(QKᵀ/√d)V。把所有人的 Q、K、V 各自摞成矩阵,一次矩阵乘法搞定——这正是它能吃满 GPU 的原因。分母的 √d 是为了防止维度高时点积数值过大,softmax 之后被少数极端值主导、梯度几乎消失。

实践中常用"多头注意力"(AI 词典:Multi-Head Attention">Multi-Head Attention):同时开几组 Q/K/V,各自关注不同侧面,有的头盯语法搭配,有的头盯指代关系,最后拼接起来。

它和 RNN、CNN 的区别

维度循环网络 RNN自注意力 Self-Attention
信息传递像传话游戏,一步接一步任意两个位置一步直达
并行能力必须按时间顺序,难以并行全序列并行
长距离依赖路径长,容易遗忘路径恒为 1,好抓
计算量随长度线性增长随长度平方增长(O(n²))

循环网络处理"第 100 个词要参考第 1 个词"时,信息得辗转 99 次,越传越淡;自注意力里这两个位置直接相乘打分,不受距离影响。

还要区分一点:经典注意力机制多用在编码器和解码器之间,是"跨序列"看;自注意力是同一序列内部自己看自己,这是 Transformer 的基石。

对从业者和普通人的意义

对从业者:它是 Transformer 里最核心的积木。理解了 Q/K/V,才好理解位置编码为什么必要(否则机制本身不区分顺序)、因果掩码Causal Mask)为什么能防止"偷看未来"、推理时的 KV Cache 为什么能加速,以及上下文长度为什么受限。

对普通人:翻译时"它"指代得对不对、长文档摘要能否抓住开头的伏笔、模型能否把相隔很远的线索串起来,背后都是这套机制在起作用。

(具体实现细节与超参数以各模型官方文档为准。)

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。