跳到主内容
快讯直播
AI智模界
AI 词典

专家并行(Expert Parallelism)

专家并行(Expert Parallelism,EP)是一种专门服务混合专家模型(Mixture of Experts,MoE)的并行策略:把不同的专家分散到不同 GPU 上,每张卡只保存和计算一部分专家。

MoE 把 Transformer 里的大前馈网络(FFN)换成很多小专家,每个 token 只被路由器(router/gate)选中少数几个专家。好处是参数总量可以做很大,但计算量不必同步变大。问题是专家参数加起来太大,一张卡显存装不下。EP 的思路就是“分开放”:专家放不下一张卡,就放到多张卡。

打个比方。一家翻译公司有上百名专科译员,不可能全挤在一间办公室。前台接到稿件后,按语种和领域分给不同楼层的译员;译完再把结果收回来。EP 里,专家就是译员,GPU 是楼层,token 是稿件,路由器是前台。每经过一个 MoE 层,稿件都要上楼、下楼一次。

难点也在这里:每步都要做跨卡路由的全对全通信(all-to-all)。具体说,每张卡先算出本地 token 该去哪些专家,然后通过 all-to-all 把 token 发给专家所在的卡;专家算完,再用一次 all-to-all 把结果送回。于是 EP 的瓶颈往往不是算力,而是卡间带宽和延迟。更麻烦的是负载不均:热门专家被很多 token 选中,它所在的卡排队,其他卡闲着。工程上会用容量因子(capacity factor)、负载均衡损失、专家复制等办法缓解,具体实现以框架官方文档为准。

和其他并行对比:

策略切分对象主要通信
数据并行 DP数据梯度同步
张量并行 TP单层内的张量每层频繁通信
流水线并行 PP网络层阶段间传激活
专家并行 EP专家集合all-to-all 路由

对从业者,EP 让 MoE 训练和推理能扩展到多卡,但设计时要关心互联带宽、all-to-all 实现、路由均衡和通信计算重叠。对普通人,可以把它理解成:MoE 模型不是“一个大脑”,而是一群专家分工;EP 决定这群专家怎么坐班,坐得越分散,沟通成本越高。评估 MoE 服务时,别只看参数量,还要看实际吞吐和延迟,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。