跳到主内容
快讯直播
AI智模界
AI 词典

万亿参数模型:规模翻十倍,难在哪

参数(Parameter)是神经网络里可被训练调整的数值,可以理解为模型内部的"旋钮"。所谓万亿参数模型(Trillion-Parameter Model),就是可训练旋钮总数达到 1 万亿(10¹²)量级的模型——大致相当于把此前千亿参数的主流大模型再放大一个数量级。

旋钮多有什么用?容量更大,能记住的知识、能区分的模式更多。麻烦也在这里:稠密(Dense)模型每处理一个字,所有旋钮都要参与计算。参数翻十倍,算力和显存也差不多翻十倍,成本吃不消。

MoE(Mixture of Experts,混合专家)是绕开这个死结的主流做法。把模型拆成几十上百个"专家"子网络,再加一个"分诊台"(路由),每个词只送进其中少数几个专家。类比医院:稠密模型是每个病人来了全体医生会诊,MoE 是先分诊、只叫相关科室。于是总参数能堆到几万亿,单次真正激活的却只有几百亿,计算开销和千亿级稠密模型处在同一量级。

维度稠密模型MoE 稀疏模型
总参数全部参与计算可远大于激活参数
单次激活100%通常只是一小部分
显存占用随参数线性增长仍随总参数增长
主要难点算力路由均衡、通信、稳定性

万亿参数真正难的地方不在"敢不敢写这么大",而在工程。训练时每个参数还要配梯度、优化器状态(如 Adam 的动量和方差),显存开销是参数本身的数倍;几千上万张加速卡要同步梯度,网络带宽常是瓶颈;跑到一半出现损失尖刺(loss spike)甚至崩掉,重启一次就是几天。数据同样是硬约束:高质量文本可能不够用,数据配比合成数据、后训练反而成了决定效果的关键。

几个相邻概念值得分清:大语言模型按用途分类,MoE 按计算方式分类,万亿参数按规模分类。三者会重叠,但不是一回事。参数量也不等于能力——激活参数、数据质量、后训练方法,往往比总参数更影响实际体感。

国内头部厂商已公开提到,下一代模型的参数规模会往 5 万亿到 10 万亿量级走(具体规格以官方发布为准)。对从业者,这意味着分布式训练、推理调度、显存优化这类系统工程能力比过去更值钱;对普通职场人,更实际的信号是:同等能力的模型,未来可能用更少的算力跑出来,也就是更便宜、更快、更容易塞进手机和业务系统。看模型别只盯参数数字,盯它每次激活多少、跑起来多贵。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。