一句话定义
激活参数(Active Parameters)指的是模型跑一次推理、生成一个词(token)时,真正参与计算的参数数量;总参数(Total Parameters)则是模型权重文件里保存的全部参数。很多传统模型这两个数相等,但在今天常见的稀疏模型(比如混合专家模型,Mixture of Experts,MoE)里,激活参数可能只有总参数的几分之一甚至更少。
打个比方:一家大医院
把模型想成一家有几百位专科医生的大医院。挂号台(路由器,Router)拿到病人(也就是当前这个词)之后,只叫最对口的几位医生来看,其余医生照常休息。下一位病人来了,被叫到的可能是另一批医生。
- 全院医生总数 = 总参数
- 每次实际看病的那几位 = 激活参数
所以"总参数上千亿"并不等于"每生成一个字都要算上千亿个参数"。这就是"总参数很大、激活很小"的本意:仓库建得很大,但每次只开一扇小门取货。
和相邻概念的区别
容易混的有三个:
| 概念 | 含义 | 主要影响 |
|---|---|---|
| 总参数 | 权重里的全部参数 | 需要多大的显存/内存装下,也关系到模型容量上限 |
| 激活参数 | 单次前向传播中实际参与计算的参数 | 算力开销、推理速度、单次生成成本 |
| 稠密 / 稀疏 | 每个输入是否都走同一套参数 | 决定上面两个数是否相等 |
稠密模型(Dense)里每个词都要过全部参数,激活参数等于总参数;稀疏模型里每个词只过一部分专家,激活参数小于总参数——而"激活多少"是动态的,不同词走的路可能不一样。
这为什么重要
设想一个模型总参数 1000 亿、每次激活 100 亿(数字仅为示意,不是任何真实模型的数据):部署时显存要按 1000 亿的份量准备,但算力和响应延迟大致按 100 亿那一档来估。对做工程的人来说,这是两条完全不同的账,采购和容量规划时很容易算错一边。
对普通职场人,它解释了为什么"参数大"和"又贵又慢"不能直接画等号:一个总参数更大的稀疏模型,单位输出的计算量可能反而更小。以后看模型宣传材料时,总参数和激活参数要一起看,只看一个容易被带偏。
也要知道稀疏不是白拿的好处:路由本身要算,专家之间可能要通信,负载不均衡时还会出现有的专家忙死、有的闲着,工程复杂度明显高于稠密模型。参数规模也只是模型能力的一部分,数据质量、训练方法、后训练策略同样关键。具体模型的规格和实现,请以官方页面为准。
