一句话定义:推理毛利率(AI 词典:Inference">Inference Gross Margin)指的是 AI 产品在"响应用户请求、把模型跑出结果"这个环节里,收入减掉直接算力成本之后剩下的比例。它衡量的是:每多做一单生意,是赚钱还是贴钱。
先把两个词拆开。"推理"(inference)是相对"训练"(training)说的。训练是把模型教出来,属于一次性的大额投入;推理是模型上线后每一次被调用——你问一句,它答一句,这都算推理。"毛利率"则是财务常识:只扣直接成本,不扣房租、工资、市场费用。
打个开出租车的比方。乘客付的车费是收入,油钱、车辆磨损、保养是直接成本,这两者的差额就是毛利。至于司机的底薪、车队办公室的租金、平台抽成,都属于间接费用,不算在毛利里。AI 推理也是同一个账本:收入来自 API 调用费、订阅费或按量计费;直接成本是 GPU 的租用费或折旧、电费、机房带宽,以及推理框架自身的调度开销。
这里最关键的一点是:推理成本会随用量线性增长,而收入不一定跟得上。今天多来一万个用户,就得多烧一万份算力,几乎没有"规模摊薄"的魔法。所以推理毛利率可能是负的——定价定低了,每接一单都在倒贴。这不是危言耸听,而是很多 AI 产品早期用补贴换增长的常态。
哪些因素在左右这个数字?模型的参数量、上下文长度、输出长度、缓存命中率、批处理(batching)效率、量化(quantization)程度、GPU 利用率、算力是自建还是租用。一个容易被忽略的细节:生成输出通常比读入输入更贵,因为输出是逐字往外蹦的,很难完全并行。
| 对比项 | 训练成本 | 推理成本 |
|---|---|---|
| 性质 | 一次性、前置投入 | 随用量增长的变动成本 |
| 类比 | 研发新车型 | 每跑一单的油钱 |
| 看什么指标 | 投入产出比、迭代速度 | 推理毛利率 |
同样容易混淆的是毛利率和净利率。毛利率只回答"这门边际生意本身划不划算";净利率还要再扣掉研发、人力、销售、市场。一个产品毛利率很高但净利率为负,说明生意本身成立,是公司在别处花钱太猛;反过来,毛利率为负就很危险——卖得越多,亏得越快。
对从业者来说,这个指标决定了三件事:怎么定价、怎么选模型、怎么优化链路。常见的手段有提示词缓存(prompt caching)、批处理、把简单请求路由给小模型、蒸馏与量化、提高 GPU 利用率。对普通职场人来说,它能解释几个日常现象:为什么长文档处理更贵、为什么"不限量"套餐往往限速、为什么免费额度会收紧。具体某家产品的计费口径和成本结构,以官方页面为准。
一句话收尾:AI 生意的账,不看你模型多聪明,先看每收一分钱,要花掉几分。
