跳到主内容
快讯直播
AI智模界
AI 词典

参数量(Parameters):7B、70B 到底指什么

一句话定义:参数量(Parameters)是模型内部可以被训练过程调整的数值的总个数。模型名里的 7B、70B 说的就是它的数量级——7B 是 70 亿个参数,B 是 billion(十亿)的缩写。

展开讲:一台超大调音台

把模型想象成一台密密麻麻全是旋钮的调音台。文字从左边进去,每经过一个旋钮就被拧一下、放大或缩小一点,一路传下去,最后输出"下一个词最可能是什么"。所谓训练,就是拿海量文本反复试,看输出对不对,再回头把几十亿个旋钮各微调一点点。参数就是这些旋钮,参数量就是"台子上有多少个旋钮"。旋钮越多,能记住的规律越细,但搬运、拧动它就越费劲。

别和这几个概念搞混

概念说的是什么常见单位
参数量 Parameters模型有多少个可调数值(体积)B(十亿)
训练数据量喂进去多少文本token(词元)
AI 词典:上下文窗口">上下文窗口 Context Window一次能"看见"多长token
计算量跑一次要算多少次FLOPs
精度 Precision每个参数用几个字节存FP16 / INT8 / INT4

它和"聪明程度"是什么关系

参数量决定的是容量上限,不是智力本身。就像书架大小和学问深浅:书架大,能装的书多,长尾知识、多任务能力通常更好;但装什么书、读得认不认真,才真正决定水平。同门同架构的模型里,大的往往更强;但小模型配上高质量数据和精细微调,在某个具体任务上完全可能打赢大模型。近年流行的混合专家MoE)架构更绕:总参数量很大,但每次只激活其中一部分,"总参数"和"激活参数"是两回事。再加上后训练、推理时多花算力等变量,单看参数量排不出座次。

对从业者和普通人的意义

从业者看到参数量,第一反应是算资源:推理时每个参数都要占内存,精度越低占得越少(FP16 约 2 字节,INT4 约 0.5 字节),再加上缓存和框架开销,就能粗略估出需要什么级别的显卡、延迟大概什么水平。普通人看到 7B、70B,只要知道这是"体积"标签:同门兄弟里越大通常越能干,跨厂商之间不能比大小——具体规格以官方页面为准。顺便一提,这里的 B 是十亿(billion),不是存储里的字节(Byte)。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。