跳到主内容
快讯直播
AI智模界
AI 词典

多头混合注意力(MoH):让注意力头按需上班

一句话定义:MoH(Mixture-of-Head Attention)是一种把AI 词典:多头注意力">多头注意力里的每个"头"当成可选专家,用一个小型路由器(router)在每次计算时动态挑选、加权组合其中一部分头的注意力机制。

先回顾基础。多头注意力(Multi-Head Attention, MHA)的做法是:把每个 token 的向量切成若干份,每一份交给一个独立的"头"去算注意力,最后拼回来。实践中不同头会自发分工——有的盯紧相邻词,有的负责长距离指代,有的似乎在处理标点结构。

问题在于,传统 MHA 是"全量固定"的:不管输入是什么,所有头都参与计算、都被一视同仁地汇总。于是两个后果出现了:算力开销写死在架构里没法调;而某些头在特定输入上其实没干什么活,成本却照付。

MoH 借用混合专家(Mixture-of-Experts, MoE)的思路:给注意力头配一个轻量打分器,输入进来先算一遍各头的"适配分",只激活得分最高的少数几个头,再按分数加权求和。头的总数可以做得很大,但每个 token 真正跑的计算只跟被选中的数量有关。

打个比方:传统 MHA 像开一场所有人都必须发言的评审会,最后把意见平均一下;MoH 像有位主持人先看这是什么项目,只请相关的那几位专家发言,并按专业度加权。专家池可以越扩越大,但每次开会的人数和时长是可控的。

它和几个容易混淆的概念区别在于"在哪儿做取舍":

机制取舍位置是否随输入变化主要收益
MHA每个头都独立全用否表达力强,计算与显存开销高
MQA / GQA多个查询头共享同一组 K/V否压缩 KV 缓存,推理更快
MoE前馈网络层的专家是参数量大而单次计算省
MoH注意力头这一维是头数可扩展,单次计算可控

关键差异是:MQA、GQA 属于静态共享,所有输入一视同仁;MoH 是输入相关的动态选择。

对从业者来说,这意味着几件要留意的事。路由是否负载均衡直接决定成败——如果少数头被反复选中,其余头会逐渐退化,等于白扩了参数。训练稳定性、以及推理时"动态选头"带来的调度开销,也需要实测:选头本身有成本,省下的算力不一定能全额兑现成更快的响应。具体实现细节和效果,以官方论文与代码仓库为准。

对普通人来说,这类工作的目标很朴素:长上下文和大模型之所以贵,是因为处理一个 token 要动用全部参数。当模型学会"这次只需要几个头上班",同样的预算就有机会处理更长的文档、承担更复杂的任务。你未必会看到 MoH 这个词,但可能会感觉到——那些需要读完整本合同、整份财报的助手,变得没那么贵了。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。