一句话定义:SSD-offloaded MoE Serving(SSD 卸载的 MoE 推理)是指不把 MoE(Mixture of Experts,混合专家)模型的全部专家权重放进显存,而是放在 NVMe 固态盘上,推理时只把当前 token 真正用到的那几个专家搬进 GPU;同时用一个小模型预测"下一步会用到谁",提前搬运,把等待时间藏进计算里。
MoE 的特点是参数总量很大、但每个 token 只激活少数几个专家,也就是稀疏激活。于是出现一种尴尬:算力其实够用,显存却装不下全部权重。这就是内存墙的下半场——瓶颈不在算得快不快,而在权重搬得动搬不动。HBM、内存、SSD 大致每层差一个数量级以上的延迟,直接按需读取,GPU 大部分时间都在空转。
打个比方:HBM 是案板,内存是冰箱,SSD 是楼下冷库。厨师做一道菜只需要三五种食材,可要是每切一刀都下楼取一趟,出菜速度就被电梯拖死了。
路由(router)选专家的决定由 token 内容决定,看着随机,其实有规律:相邻 token、上下层之间存在相关性。于是先跑一段真实流量,记录"哪些 token 去了哪些专家",用这些轨迹训练一个轻量预测器(训练式路由预测),推理时提前说"下面两层大概率要 17 号和 42 号专家",让 I/O 与计算重叠。命中率高,SSD 慢这件事就被掩盖;命中率低,一切照旧卡。
| 做法 | 谁来触发搬运 | 效果 |
|---|---|---|
| 全量驻留显存 | 不搬 | 最快,但要多卡堆显存 |
| 被动换页 / CPU offload | 缺了才搬 | 实现简单,延迟尖刺明显 |
| 训练式路由预测 + SSD | 提前猜 | 用数据换带宽,单机也能跑大 MoE |
它和量化、剪枝不是一回事:那些是"少存点",这是"存得远但搬得准",两者可以叠加;和 KV cache 卸载也不同,搬的对象是专家权重。
对从业者,价值在长尾部署:热门大模型有人堆集群,冷门模型、私有化交付、低频业务往往只有一两张卡加一块大 SSD,这条路线让它们跑得起来。代价是延迟和吞吐不如全量驻留,且预测器要针对自己的流量重新采集训练数据——换了业务就得重来。对普通人,它意味着以后会有更多"小而专"的模型被塞进一台机器里,跑在你身边的设备上,而不是全都在云端。具体容量、带宽和性能表现以官方页面与实测为准。
