跳到主内容
快讯直播
AI智模界
AI 词典

推理(Inference):模型"上班"的那一刻

一句话定义:推理(Inference)指训练好的模型接收输入、算出输出的那一次前向计算。你每问一句、每生成一个字,背后都是一次推理。

训练像建厂,推理像开工

训练是建厂:买地、进设备、反复试产、调参数,前期投入巨大,但基本只干一次。推理是开工生产:厂子建好后按订单出货,单件成本不高,但订单量可以无限涨,而且一停就是损失。

更日常的比方:训练是"把菜谱研发出来",推理是"每天按菜谱炒菜上桌"。研发团队很贵但不用常驻;炒菜师傅不需要创造力,但得出餐快、成本低、一天炒几千份。

成本结构为什么完全不同

训练 Training推理 Inference
花钱节奏一次性、大额持续、随用量线性增长
主要瓶颈算力总量、并行效率延迟、吞吐、单次成本
优化方向更大集群、更高利用率量化、蒸馏、缓存、批处理
失败代价白烧一轮钱和时间用户等不及直接关掉页面

训练拼的是"能不能做出来",推理拼的是"能不能便宜又快地一直做下去"。

推理内部还分两段

  • 预填充(prefill):把你的整段提问一次读完并算出缓存,是并行的,吃算力,决定你多久看到第一个字。
  • 解码(decode):一个字一个字往外蹦,每出一个字都要重算一遍,是串行的,决定输出速度。

这解释了为什么长上下文更贵,也解释了为什么多轮对话里重复的系统提示可以靠缓存(KV cache)省下来。

别和这几个概念搞混

  • 训练改权重,推理不改权重。你用产品时的交互不会让模型"记住",除非厂商另外做了记忆或微调机制。
  • 微调(AI 词典:Fine-tuning">Fine-tuning)本质上是一次小规模训练,产物仍然是一个需要推理的模型。
  • 推理 ≠ 逻辑推理。中文里这两个词撞车了:这里的推理指"跑一次前向计算",跟思维链那套"推理能力"是两码事,读文档时要看上下文。

对从业者意味着什么

做产品的要算清单位经济学:一次对话大概烧多少 token,贵在哪,能不能用缓存、路由、小模型挡掉简单请求。做工程的别只盯着效果,首字延迟和每 token 成本往往才是留存杀手。做预算的要意识到,模型上线只是开始,推理账单按月交、随用户增长而增长——这也是"更小更专的模型"和推理优化一直热门的原因。

对普通人意味着什么

每一次对话、每一次生成图片,都在消耗真实算力。免费额度、限流、高峰期变慢,背后都是推理成本在起作用。至于具体资费,以各家官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。