跳到主内容
快讯直播
AI智模界
AI 词典

共享专家:MoE 里总在岗的公共专家

一句话定义:共享专家(Shared Expert)是混合专家模型(Mixture-of-Experts, MoE)中那部分“每个 token 都会经过”的专家,不依赖路由器(router)挑选,专门处理通用、公共的知识。

先看普通 MoE 怎么工作。一个 Transformer 层里,原本的 Feed-Forward Network(FFN)被拆成很多个“专家”。每个 token 进来,路由器会打分,只选 top-k 个专家参与计算。这样总参数量可以很大,但每个 token 实际激活的参数量较小,既省算力,又能让不同专家学不同模式。

问题是:如果所有专家都只被“偶尔选中”,那么像语法、常见搭配、基础常识这类公共知识,就可能被很多专家重复学习,浪费容量;同时路由一波动,输出容易不稳定。共享专家的思路很直接:留一个或几个专家永远激活,所有 token 都过一遍。它像一个公司的公共支持部门——财务、法务、行政永远在岗,项目组则按需调用后端、算法、设计等专家。公共部门处理大家都要用的基础事务,项目专家就能更专注细分能力。

它和路由专家(Routed Expert)的区别可以这样看:

维度共享专家路由专家
是否总是激活是,每个 token 都过否,由路由器按 token 选
主要职责通用知识、稳定表征细分模式、专业能力
计算特征固定开销,构成延迟下限稀疏激活,随路由变化
训练作用减少重复学习,稳住输出提供容量和 specialization

它也不是“稠密 FFN”的简单回归。共享专家通常只是 MoE 中的一小部分,整体仍然是稀疏激活;它更像是给稀疏系统加了一根“公共底座”。另外,不同 MoE 设计差异很大:有的模型有共享专家,有的没有;共享专家放在哪些层、有几个,也各不相同,具体以官方页面或论文为准。

对从业者来说,理解共享专家有两个实际意义。第一,读 MoE 论文时,要区分“总参数量”和“每 token 激活参数量”;共享专家会增加固定激活开销,但可能换来更好的通用能力和训练稳定性。第二,做部署估算时,共享专家是每次前向都要算的,因此会影响延迟下限和显存占用,不能只按路由专家的稀疏比例来估。

对普通职场人,可以把它记成一句话:共享专家就是团队里那个永远在岗的“公共底座”,让按需出场的专家们不必重复造轮子,能更专注自己的绝活。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。