一句话定义:推理(Inference)指训练好的模型接收输入、算出输出的那一次前向计算。你每问一句、每生成一个字,背后都是一次推理。
训练像建厂,推理像开工
训练是建厂:买地、进设备、反复试产、调参数,前期投入巨大,但基本只干一次。推理是开工生产:厂子建好后按订单出货,单件成本不高,但订单量可以无限涨,而且一停就是损失。
更日常的比方:训练是"把菜谱研发出来",推理是"每天按菜谱炒菜上桌"。研发团队很贵但不用常驻;炒菜师傅不需要创造力,但得出餐快、成本低、一天炒几千份。
成本结构为什么完全不同
| 训练 Training | 推理 Inference | |
|---|---|---|
| 花钱节奏 | 一次性、大额 | 持续、随用量线性增长 |
| 主要瓶颈 | 算力总量、并行效率 | 延迟、吞吐、单次成本 |
| 优化方向 | 更大集群、更高利用率 | 量化、蒸馏、缓存、批处理 |
| 失败代价 | 白烧一轮钱和时间 | 用户等不及直接关掉页面 |
训练拼的是"能不能做出来",推理拼的是"能不能便宜又快地一直做下去"。
推理内部还分两段
- 预填充(prefill):把你的整段提问一次读完并算出缓存,是并行的,吃算力,决定你多久看到第一个字。
- 解码(decode):一个字一个字往外蹦,每出一个字都要重算一遍,是串行的,决定输出速度。
这解释了为什么长上下文更贵,也解释了为什么多轮对话里重复的系统提示可以靠缓存(KV cache)省下来。
别和这几个概念搞混
- 训练改权重,推理不改权重。你用产品时的交互不会让模型"记住",除非厂商另外做了记忆或微调机制。
- 微调(AI 词典:Fine-tuning">Fine-tuning)本质上是一次小规模训练,产物仍然是一个需要推理的模型。
- 推理 ≠ 逻辑推理。中文里这两个词撞车了:这里的推理指"跑一次前向计算",跟思维链那套"推理能力"是两码事,读文档时要看上下文。
对从业者意味着什么
做产品的要算清单位经济学:一次对话大概烧多少 token,贵在哪,能不能用缓存、路由、小模型挡掉简单请求。做工程的别只盯着效果,首字延迟和每 token 成本往往才是留存杀手。做预算的要意识到,模型上线只是开始,推理账单按月交、随用户增长而增长——这也是"更小更专的模型"和推理优化一直热门的原因。
对普通人意味着什么
每一次对话、每一次生成图片,都在消耗真实算力。免费额度、限流、高峰期变慢,背后都是推理成本在起作用。至于具体资费,以各家官方页面为准。
