一句话定义
混合架构(Hybrid Transformer-Mamba)是指在一个大模型里同时保留 Transformer 的注意力层(attention)和 Mamba 这类状态空间层(state space model,SSM),把两种层交替堆叠起来的设计——用少量注意力层保住精度,用大量便宜的层省下显存和算力。
为什么需要它
注意力机制的工作方式是:序列里每个位置都要和所有位置"互相看一遍"。序列长度翻倍,计算量大约翻四倍(常说的 O(n²));推理时还要为每个 token 缓存键值(KV cache),上下文越长,显存占用越大。
SSM 走的是另一条路:它像一条流水线,把读过的历史压缩成一个固定大小的"状态",每来一个新 token 就更新一次。计算量和显存基本不随上下文长度增长,训练时还能用并行扫描(scan)把递归过程并行化。
打个比方
注意力层像开全体大会:每个人发言前先把全场所有人的发言记录都翻一遍,结论最准,但人一多就开不动、场地费也贵。
SSM 层像一位秘书维护的滚动摘要本:永远只有一页纸,边听边改,成本恒定,但细节会被抹掉,想精确查"某人第三句说了什么"就困难。
混合架构的做法就是:日常流程走摘要本,关键节点再开大会。大部分层用 SSM,中间插入少量注意力层,让注意力负责精确回忆和全局对齐,其余交给便宜层扛。
和相邻概念的区别
| 方案 | 长序列计算 | 推理显存 | 弱点 |
|---|---|---|---|
| 纯 Transformer | 随长度平方增长 | KV cache 随长度线性增长 | 长上下文贵 |
| 纯 Mamba / SSM | 随长度线性增长 | 状态固定,基本不涨 | 精确检索、逐字回忆偏弱 |
| 混合架构 | 介于两者之间 | 主要开销集中在少量注意力层 | 结构更复杂,需调层间配比 |
它和稀疏注意力、滑窗注意力也不同:那些仍然是注意力,只是缩小了"看谁"的范围;混合架构是换了一部分层的计算范式。它也不同于 MoE(混合专家),MoE 省的是前馈层的算力,混合架构省的是序列建模本身的开销。
对从业者的意义
看架构图时,重点不是"有没有注意力",而是注意力层占多少、放在哪几层——这直接决定长上下文训练的显存预算和推理吞吐。工程上,混合架构往往意味着同样的硬件能塞进更长的材料,长文档问答、长对话、代码库级检索这类场景更划算。
对普通用户来说,感受是"能一次喂进去的资料变多了、响应更稳",但具体到某个模型的实际表现、上下文上限和部署成本,以官方页面和实测为准。
