一句话定义
推理成本通缩(AI 词典:Inference">Inference Cost Deflation)指的是:拿到同等质量的模型输出,需要付出的单位成本——通常按每百万 token 计价——在持续、结构性地下降。注意"同等质量"这个前提。如果变便宜是因为把模型换小了、答案变差了,那不叫通缩,那叫降级。
为什么几家一起降
把模型服务想成一家餐厅。最早的做法是:客人点一道菜,厨师现切现炒,一桌配一个厨师。贵,是因为厨师(GPU)大部分时间在等——等食材、等客人把菜单念完。现在餐厅做了四件事。
稀疏化(sparsity):请一整支厨师队伍,但每道菜只叫醒需要的两三个人。混合专家(MoE, Mixture of Experts)就是这个思路的通俗版——模型总参数很大,单次真正参与计算的只是一小部分,算力花在刀刃上。
缓存(caching):常客每次都重念一遍同样的开场白太浪费。系统提示、长文档、多轮对话的前文,算过一次就把中间结果存下来复用,这部分不再重复付出算力。提示缓存(prompt caching)省下的往往是最直观的一块。
批处理(batching):以前一桌一桌做,现在攒够一批同时下锅。GPU 最怕闲着,把许多请求拼在一起算,同样的电费能出更多菜。服务端的吞吐优化,用户看不见,但直接体现在单价上。
量化与蒸馏(quantization / distillation):把大厨的手艺写成标准菜谱,交给更便宜的人执行。前者降低单个数值的精度,后者让小模型去模仿大模型的输出分布。
商业侧还有另一股力:价格战。厂商愿意先贴着成本卖抢份额。但要分清——价格战是短期让利,可以停;通缩是结构趋势,停不下来。两者叠加时,你看到的才是"腰斩"。
和相邻概念的区别
| 概念 | 关注什么 | 与推理成本通缩的关系 |
|---|---|---|
| 摩尔定律(Moore's Law) | 单位晶体管成本 | 底层硬件推力,但通缩主要来自软件与架构 |
| 规模经济 | 摊薄固定成本 | 同一件事在商业账上的体现 |
| 价格战 | 厂商主动让利 | 短期加速器,不等于通缩本身 |
| 模型蒸馏 | 小模型学大模型 | 实现通缩的技术手段之一 |
对实际工作的意义
对从业者:别把"省 token"当成长期护城河,它正在被自动抹平。更值钱的是架构层面的便宜——缓存友好的提示结构、能分级降级的模型路由(简单问题走小模型,难题才上调)、把贵算力留给真正需要深推理的环节。
对普通职场人:用得起的智能在快速普及。长文档处理、多轮 Agent 流程、批量自动化,过去是预算问题,现在更多是设计问题。
这里有个反直觉的坑——杰文斯悖论(Jevons Paradox):单价降了,用量往往涨得更快,总账单反而变高。所以"单位成本通缩"不等于"你的账单会变少",它只说明同样一笔钱能买到更多智能。
具体价格、型号与计费规则随时在变,以官方页面为准。
