一句话定义:参数量(Parameters)是模型内部可以被训练过程调整的数值的总个数。模型名里的 7B、70B 说的就是它的数量级——7B 是 70 亿个参数,B 是 billion(十亿)的缩写。
展开讲:一台超大调音台
把模型想象成一台密密麻麻全是旋钮的调音台。文字从左边进去,每经过一个旋钮就被拧一下、放大或缩小一点,一路传下去,最后输出"下一个词最可能是什么"。所谓训练,就是拿海量文本反复试,看输出对不对,再回头把几十亿个旋钮各微调一点点。参数就是这些旋钮,参数量就是"台子上有多少个旋钮"。旋钮越多,能记住的规律越细,但搬运、拧动它就越费劲。
别和这几个概念搞混
| 概念 | 说的是什么 | 常见单位 |
|---|---|---|
| 参数量 Parameters | 模型有多少个可调数值(体积) | B(十亿) |
| 训练数据量 | 喂进去多少文本 | token(词元) |
| AI 词典:上下文窗口">上下文窗口 Context Window | 一次能"看见"多长 | token |
| 计算量 | 跑一次要算多少次 | FLOPs |
| 精度 Precision | 每个参数用几个字节存 | FP16 / INT8 / INT4 |
它和"聪明程度"是什么关系
参数量决定的是容量上限,不是智力本身。就像书架大小和学问深浅:书架大,能装的书多,长尾知识、多任务能力通常更好;但装什么书、读得认不认真,才真正决定水平。同门同架构的模型里,大的往往更强;但小模型配上高质量数据和精细微调,在某个具体任务上完全可能打赢大模型。近年流行的混合专家(MoE)架构更绕:总参数量很大,但每次只激活其中一部分,"总参数"和"激活参数"是两回事。再加上后训练、推理时多花算力等变量,单看参数量排不出座次。
对从业者和普通人的意义
从业者看到参数量,第一反应是算资源:推理时每个参数都要占内存,精度越低占得越少(FP16 约 2 字节,INT4 约 0.5 字节),再加上缓存和框架开销,就能粗略估出需要什么级别的显卡、延迟大概什么水平。普通人看到 7B、70B,只要知道这是"体积"标签:同门兄弟里越大通常越能干,跨厂商之间不能比大小——具体规格以官方页面为准。顺便一提,这里的 B 是十亿(billion),不是存储里的字节(Byte)。
