跳到主内容
快讯直播
AI智模界
AI 词典

推理成本通缩:模型为什么越来越便宜

一句话定义

推理成本通缩(AI 词典:Inference">Inference Cost Deflation)指的是:拿到同等质量的模型输出,需要付出的单位成本——通常按每百万 token 计价——在持续、结构性地下降。注意"同等质量"这个前提。如果变便宜是因为把模型换小了、答案变差了,那不叫通缩,那叫降级。

为什么几家一起降

把模型服务想成一家餐厅。最早的做法是:客人点一道菜,厨师现切现炒,一桌配一个厨师。贵,是因为厨师(GPU)大部分时间在等——等食材、等客人把菜单念完。现在餐厅做了四件事。

稀疏化(sparsity):请一整支厨师队伍,但每道菜只叫醒需要的两三个人。混合专家MoE, Mixture of Experts)就是这个思路的通俗版——模型总参数很大,单次真正参与计算的只是一小部分,算力花在刀刃上。

缓存(caching):常客每次都重念一遍同样的开场白太浪费。系统提示、长文档、多轮对话的前文,算过一次就把中间结果存下来复用,这部分不再重复付出算力。提示缓存(prompt caching)省下的往往是最直观的一块。

批处理(batching):以前一桌一桌做,现在攒够一批同时下锅。GPU 最怕闲着,把许多请求拼在一起算,同样的电费能出更多菜。服务端的吞吐优化,用户看不见,但直接体现在单价上。

量化与蒸馏(quantization / distillation):把大厨的手艺写成标准菜谱,交给更便宜的人执行。前者降低单个数值的精度,后者让小模型去模仿大模型的输出分布。

商业侧还有另一股力:价格战。厂商愿意先贴着成本卖抢份额。但要分清——价格战是短期让利,可以停;通缩是结构趋势,停不下来。两者叠加时,你看到的才是"腰斩"。

和相邻概念的区别

概念关注什么与推理成本通缩的关系
摩尔定律(Moore's Law)单位晶体管成本底层硬件推力,但通缩主要来自软件与架构
规模经济摊薄固定成本同一件事在商业账上的体现
价格战厂商主动让利短期加速器,不等于通缩本身
模型蒸馏小模型学大模型实现通缩的技术手段之一

对实际工作的意义

对从业者:别把"省 token"当成长期护城河,它正在被自动抹平。更值钱的是架构层面的便宜——缓存友好的提示结构、能分级降级的模型路由(简单问题走小模型,难题才上调)、把贵算力留给真正需要深推理的环节。

对普通职场人:用得起的智能在快速普及。长文档处理、多轮 Agent 流程、批量自动化,过去是预算问题,现在更多是设计问题。

这里有个反直觉的坑——杰文斯悖论(Jevons Paradox):单价降了,用量往往涨得更快,总账单反而变高。所以"单位成本通缩"不等于"你的账单会变少",它只说明同样一笔钱能买到更多智能。

具体价格、型号与计费规则随时在变,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。