跳到主内容
快讯直播
AI智模界
AI 词典

激活值量化:为什么端侧推理最难的一环在这里

一句话定义:激活值量化(Activation AI 词典:Quantization">Quantization)是把神经网络每一层在前向计算中"当场产生"的中间结果,从高精度浮点数压缩成低比特整数(常见是 8 位或 4 位)的过程,目的是省内存带宽、省算力、降功耗。

先分清两种"要量化的东西"

模型里有两类数字。一类是权重(weight),也就是训练完就固定下来的参数;另一类是激活值(activation),也就是输入数据流经网络时,每一层临时算出来的中间结果。两者的性格完全不同。

打个比方:权重像一家餐厅提前印好的菜单和备货清单,开门前就知道要准备什么,可以慢慢调整、反复试算;激活值像客人现场点的菜——今天来的是谁、点什么、点多少,开门前根本不知道。量化权重是"提前规划库存",量化激活值是"现场限制作业"。

难在哪:动态范围会跑

量化的核心动作是找一个缩放因子(scale),把一段浮点区间映射到整数格子里。权重分布稳定,标定一次基本够用;激活值的范围却随每一条输入变化,而且常常出现"离群值"(outlier)——少数通道的数值比其它通道大出很多倍。如果按整个张量共用一个缩放因子,为了装下那个巨大的离群值,其它绝大多数数值就被挤到只剩几个整数格子,精度全丢了。

业界的应对有几条路:把粒度变细,按通道(per-channel)甚至按 token(per-token)单独算缩放因子;对离群值做裁剪(clipping)或把难以量化的部分留在高精度里;在量化前做数学上的"搬移",把激活的难度转移一部分给权重。粒度越细、越动态,精度越好,但额外的统计和换算本身也要开销,这就是取舍。

和相邻概念的区别

概念量化对象特点
权重仅量化(如 W8A16)只有权重最容易,主要省显存和加载带宽
权激活全量化(如 W8A8)权重 + 激活才能真正用上整数算力,难点在激活
训练后量化(PTQ)训练后标定成本低,靠校准数据估范围
量化感知训练(QAT)训练中模拟量化精度更好,但要重新训练
KV 缓存量化注意力缓存大模型长上下文解码时的显存大头

对从业者的实际意义

大模型推理,尤其是一次只出一个 token 的解码阶段,瓶颈往往不是算力而是内存带宽——每生成一个字都要把权重和缓存搬一遍。端侧设备(手机、车机、边缘盒子)上,带宽和发热是硬约束,所以"权重压下来、激活压不下来"等于只解决了一半问题。评估一款推理框架时,重点看它对激活量化的支持粒度、是否支持动态量化、以及哪些算子能真正跑在整数路径上——具体支持情况以官方页面为准。

对普通职场人,记住一句就够:权重是提前备好的库存,激活是现场流动的客流;压库存容易,压客流难。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。