参数(Parameter)是神经网络里可被训练调整的数值,可以理解为模型内部的"旋钮"。所谓万亿参数模型(Trillion-Parameter Model),就是可训练旋钮总数达到 1 万亿(10¹²)量级的模型——大致相当于把此前千亿参数的主流大模型再放大一个数量级。
旋钮多有什么用?容量更大,能记住的知识、能区分的模式更多。麻烦也在这里:稠密(Dense)模型每处理一个字,所有旋钮都要参与计算。参数翻十倍,算力和显存也差不多翻十倍,成本吃不消。
MoE(Mixture of Experts,混合专家)是绕开这个死结的主流做法。把模型拆成几十上百个"专家"子网络,再加一个"分诊台"(路由),每个词只送进其中少数几个专家。类比医院:稠密模型是每个病人来了全体医生会诊,MoE 是先分诊、只叫相关科室。于是总参数能堆到几万亿,单次真正激活的却只有几百亿,计算开销和千亿级稠密模型处在同一量级。
| 维度 | 稠密模型 | MoE 稀疏模型 |
|---|---|---|
| 总参数 | 全部参与计算 | 可远大于激活参数 |
| 单次激活 | 100% | 通常只是一小部分 |
| 显存占用 | 随参数线性增长 | 仍随总参数增长 |
| 主要难点 | 算力 | 路由均衡、通信、稳定性 |
万亿参数真正难的地方不在"敢不敢写这么大",而在工程。训练时每个参数还要配梯度、优化器状态(如 Adam 的动量和方差),显存开销是参数本身的数倍;几千上万张加速卡要同步梯度,网络带宽常是瓶颈;跑到一半出现损失尖刺(loss spike)甚至崩掉,重启一次就是几天。数据同样是硬约束:高质量文本可能不够用,数据配比、合成数据、后训练反而成了决定效果的关键。
几个相邻概念值得分清:大语言模型按用途分类,MoE 按计算方式分类,万亿参数按规模分类。三者会重叠,但不是一回事。参数量也不等于能力——激活参数、数据质量、后训练方法,往往比总参数更影响实际体感。
国内头部厂商已公开提到,下一代模型的参数规模会往 5 万亿到 10 万亿量级走(具体规格以官方发布为准)。对从业者,这意味着分布式训练、推理调度、显存优化这类系统工程能力比过去更值钱;对普通职场人,更实际的信号是:同等能力的模型,未来可能用更少的算力跑出来,也就是更便宜、更快、更容易塞进手机和业务系统。看模型别只盯参数数字,盯它每次激活多少、跑起来多贵。
