跳到主内容
快讯直播
AI智模界
AI 词典

SSD 卸载的 MoE 推理:让专家住进固态盘

一句话定义:SSD-offloaded MoE Serving(SSD 卸载的 MoE 推理)是指不把 MoE(Mixture of Experts,混合专家)模型的全部专家权重放进显存,而是放在 NVMe 固态盘上,推理时只把当前 token 真正用到的那几个专家搬进 GPU;同时用一个小模型预测"下一步会用到谁",提前搬运,把等待时间藏进计算里。

MoE 的特点是参数总量很大、但每个 token 只激活少数几个专家,也就是稀疏激活。于是出现一种尴尬:算力其实够用,显存却装不下全部权重。这就是内存墙的下半场——瓶颈不在算得快不快,而在权重搬得动搬不动。HBM、内存、SSD 大致每层差一个数量级以上的延迟,直接按需读取,GPU 大部分时间都在空转。

打个比方:HBM 是案板,内存是冰箱,SSD 是楼下冷库。厨师做一道菜只需要三五种食材,可要是每切一刀都下楼取一趟,出菜速度就被电梯拖死了。

路由(router)选专家的决定由 token 内容决定,看着随机,其实有规律:相邻 token、上下层之间存在相关性。于是先跑一段真实流量,记录"哪些 token 去了哪些专家",用这些轨迹训练一个轻量预测器(训练式路由预测),推理时提前说"下面两层大概率要 17 号和 42 号专家",让 I/O 与计算重叠。命中率高,SSD 慢这件事就被掩盖;命中率低,一切照旧卡。

做法谁来触发搬运效果
全量驻留显存不搬最快,但要多卡堆显存
被动换页 / CPU offload缺了才搬实现简单,延迟尖刺明显
训练式路由预测 + SSD提前猜用数据换带宽,单机也能跑大 MoE

它和量化、剪枝不是一回事:那些是"少存点",这是"存得远但搬得准",两者可以叠加;和 KV cache 卸载也不同,搬的对象是专家权重。

对从业者,价值在长尾部署:热门大模型有人堆集群,冷门模型、私有化交付、低频业务往往只有一两张卡加一块大 SSD,这条路线让它们跑得起来。代价是延迟和吞吐不如全量驻留,且预测器要针对自己的流量重新采集训练数据——换了业务就得重来。对普通人,它意味着以后会有更多"小而专"的模型被塞进一台机器里,跑在你身边的设备上,而不是全都在云端。具体容量、带宽和性能表现以官方页面与实测为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。