跳到主内容
快讯直播
AI智模界
论文

论文:用可训练路由预测从 SSD 服务 35B MoE

arXiv 上新收录一篇论文,题为《The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction》,归类为论文。

大模型推理的"显存墙",讨论通常集中在权重放不进 GPU 显存、需要向 CPU 内存卸载。这篇工作指向的是这道墙的另一半:把 SSD 纳入服务链路,直接面向 35B 规模的混合专家(MoE)模型做推理服务。

MoE 的关键特征是稀疏激活——每个 token 只经过少数专家,单次前向的算力需求可控;但路由是动态的,哪些专家会被命中事先并不确定。当专家权重分散在存储上时,动态路由会让 I/O 难以预测,换入换出的开销容易吞掉稀疏性带来的收益。从标题看,该论文的思路是训练一个路由预测模块,提前判断即将被激活的专家,在其真正被需要之前把权重从 SSD 预取上来,让 SSD 成为内存层级的延伸,而非最后的兜底。

为什么重要:如果路由能够被可靠预测,MoE 服务的瓶颈就从"装不下"转向"搬得够不够快",从而放宽对单机显存容量的硬性约束,降低大规模 MoE 部署的硬件门槛。

需要说明的是,目前可获得的信息仅为论文标题与分类,摘要、具体方法与实验数据尚未披露;预测精度对生成质量的影响、实际吞吐收益等关键问题,仍需查阅原文确认。

论文链接:https://arxiv.org/abs/2609.18063

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。