跳到主内容
快讯直播
AI智模界
AI 词典

激活参数:大模型每次只叫醒一部分

一句话定义

激活参数(Active Parameters)指的是模型跑一次推理、生成一个词(token)时,真正参与计算的参数数量;总参数(Total Parameters)则是模型权重文件里保存的全部参数。很多传统模型这两个数相等,但在今天常见的稀疏模型(比如混合专家模型,Mixture of Experts,MoE)里,激活参数可能只有总参数的几分之一甚至更少。

打个比方:一家大医院

把模型想成一家有几百位专科医生的大医院。挂号台(路由器,Router)拿到病人(也就是当前这个词)之后,只叫最对口的几位医生来看,其余医生照常休息。下一位病人来了,被叫到的可能是另一批医生。

  • 全院医生总数 = 总参数
  • 每次实际看病的那几位 = 激活参数

所以"总参数上千亿"并不等于"每生成一个字都要算上千亿个参数"。这就是"总参数很大、激活很小"的本意:仓库建得很大,但每次只开一扇小门取货。

和相邻概念的区别

容易混的有三个:

概念含义主要影响
总参数权重里的全部参数需要多大的显存/内存装下,也关系到模型容量上限
激活参数单次前向传播中实际参与计算的参数算力开销、推理速度、单次生成成本
稠密 / 稀疏每个输入是否都走同一套参数决定上面两个数是否相等

稠密模型(Dense)里每个词都要过全部参数,激活参数等于总参数;稀疏模型里每个词只过一部分专家,激活参数小于总参数——而"激活多少"是动态的,不同词走的路可能不一样。

这为什么重要

设想一个模型总参数 1000 亿、每次激活 100 亿(数字仅为示意,不是任何真实模型的数据):部署时显存要按 1000 亿的份量准备,但算力和响应延迟大致按 100 亿那一档来估。对做工程的人来说,这是两条完全不同的账,采购和容量规划时很容易算错一边。

对普通职场人,它解释了为什么"参数大"和"又贵又慢"不能直接画等号:一个总参数更大的稀疏模型,单位输出的计算量可能反而更小。以后看模型宣传材料时,总参数和激活参数要一起看,只看一个容易被带偏。

也要知道稀疏不是白拿的好处:路由本身要算,专家之间可能要通信,负载不均衡时还会出现有的专家忙死、有的闲着,工程复杂度明显高于稠密模型。参数规模也只是模型能力的一部分,数据质量、训练方法、后训练策略同样关键。具体模型的规格和实现,请以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。