小工具 · 大模型显存估算
按模型参数规模、量化精度和上下文长度估算显存占用:权重 + KV 缓存 + 运行开销。结果为理论估算值,实际还受推理框架、并发数和是否微调影响。
—
GB 显存
选择模型规格开始估算
权重
0
GB
KV 缓存
0
GB
运行开销
0
GB
参数规模
1.5B(小模型)
7B / 8B(主流开源)
14B
32B
70B
精度
FP16 / BF16(原始精度)
INT8(8 位量化)
INT4(4 位量化)
上下文
4K
32K
128K
微调吗
只做推理
LoRA 微调
全量微调
估算口径:权重按参数量 × 精度字节数;KV 缓存按层数 × 隐藏维度 × 上下文估算;开销按推理框架预留。