跳到主内容
快讯直播
AI智模界
AI 词典

1-bit LLM / BitNet:权重只有三种取值

一句话定义:1-bit LLM 指的是把大语言模型的权重(weight)压到极低比特——典型是三值 {-1, 0, 1},平均每个权重只要约 1.58 比特——的一类模型;BitNet 是这类三元权重架构的代表性名字。

原理:当乘法退化成加减法

常规模型的权重是 16 位浮点数。一层网络做的事,是把输入的数字(激活值)挨个乘以对应权重,再全部加起来——也就是"乘法+累加"。这中间最贵的是乘法器,它在芯片里占面积、更费电。

如果权重只允许是 -1、0、1,乘法就消失了:

  • 乘 1 → 加上原数
  • 乘 -1 → 减去原数
  • 乘 0 → 直接跳过

打个比方:原本每笔账都要算"单价 × 数量",现在单价被限制成三句口令——"记一笔""抹掉""反着记一笔",你只要做加减。省下的不是小钱,是电和延迟。

它不是"训练完再砍精度"

对比项常规 FP16 模型训练后 4-bit 量化1-bit LLM
权重表示16 位浮点约 4 位整数三值 {-1, 0, 1}
核心运算乘法+累加整数乘加以加减法为主
低比特何时介入多在训练之后训练阶段就约束

关键差别在这里:把已经训好的模型硬截断成三值,精度通常会塌。这类模型的做法是让模型在训练时就习惯 {-1,0,1} 这种取值,学会"只用三档来表达知识"。另外,通常只有权重是三值,激活值仍保留较高精度(例如 8 位整数),因为激活对精度更敏感。所以"1-bit"说的是权重,不是整条计算链路的每一位——具体设定以论文或官方页面为准。

它也和剪枝(pruning)不同:剪枝是把部分连接拿掉,留下的权重照样是浮点数。

对从业者和普通人的意义

对做部署的人,大模型推理常常卡在显存带宽和能耗上,而不是算力峰值。权重比特数越低,同样的显存能装下更大的模型,端侧、手机、嵌入式设备就更有想象力。代价也很实在:精度损失、算子与硬件的配套支持、训练工具链的成熟度,都还需要时间。

对普通人,这条路线若走通,意味着本地跑的小助手更省电、更便宜,数据也不必离开设备。但要记住:它是追求极致能效的一条路线,不是"所有模型都会变成 1-bit"。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。