一句话定义:1-bit LLM 指的是把大语言模型的权重(weight)压到极低比特——典型是三值 {-1, 0, 1},平均每个权重只要约 1.58 比特——的一类模型;BitNet 是这类三元权重架构的代表性名字。
原理:当乘法退化成加减法
常规模型的权重是 16 位浮点数。一层网络做的事,是把输入的数字(激活值)挨个乘以对应权重,再全部加起来——也就是"乘法+累加"。这中间最贵的是乘法器,它在芯片里占面积、更费电。
如果权重只允许是 -1、0、1,乘法就消失了:
- 乘 1 → 加上原数
- 乘 -1 → 减去原数
- 乘 0 → 直接跳过
打个比方:原本每笔账都要算"单价 × 数量",现在单价被限制成三句口令——"记一笔""抹掉""反着记一笔",你只要做加减。省下的不是小钱,是电和延迟。
它不是"训练完再砍精度"
| 对比项 | 常规 FP16 模型 | 训练后 4-bit 量化 | 1-bit LLM |
|---|---|---|---|
| 权重表示 | 16 位浮点 | 约 4 位整数 | 三值 {-1, 0, 1} |
| 核心运算 | 乘法+累加 | 整数乘加 | 以加减法为主 |
| 低比特何时介入 | — | 多在训练之后 | 训练阶段就约束 |
关键差别在这里:把已经训好的模型硬截断成三值,精度通常会塌。这类模型的做法是让模型在训练时就习惯 {-1,0,1} 这种取值,学会"只用三档来表达知识"。另外,通常只有权重是三值,激活值仍保留较高精度(例如 8 位整数),因为激活对精度更敏感。所以"1-bit"说的是权重,不是整条计算链路的每一位——具体设定以论文或官方页面为准。
它也和剪枝(pruning)不同:剪枝是把部分连接拿掉,留下的权重照样是浮点数。
对从业者和普通人的意义
对做部署的人,大模型推理常常卡在显存带宽和能耗上,而不是算力峰值。权重比特数越低,同样的显存能装下更大的模型,端侧、手机、嵌入式设备就更有想象力。代价也很实在:精度损失、算子与硬件的配套支持、训练工具链的成熟度,都还需要时间。
对普通人,这条路线若走通,意味着本地跑的小助手更省电、更便宜,数据也不必离开设备。但要记住:它是追求极致能效的一条路线,不是"所有模型都会变成 1-bit"。
