跳到主内容
快讯直播
AI智模界
AI 词典

模型级联:先让便宜模型试,搞不定再上大模型

一句话定义:模型级联(Model Cascade)是把几个能力和成本不同的模型串成一条流水线——请求先交给最小最便宜的模型,只有当它答不好、没把握时,才逐级升级给更大的模型。

打个比方:医院分诊

你去医院看病,不会一进门就挂专家号。先到社区门诊,医生能处理的直接开药;发现情况复杂,才写张转诊单让你去三甲。模型级联就是这个逻辑:小模型像社区医生,覆盖掉大量常见问题;大模型像专家,只接被转诊上来的疑难件。

一次典型的级联长这样:

1. 第一级:小模型给出答案,同时输出一个"我有多确定"的信号。

2. 判据层:检查这个信号。置信度够高、格式校验通过、多次采样答案一致,就直接返回。

3. 升级:否则把原始请求(有时连小模型的草稿一起)交给上一级更大的模型。

4. 兜底:可以设两三级,也可以加规则——比如涉及金额、合同条款的请求一律跳过小模型。

级联能不能省钱,取决于一个前提:大部分请求其实是简单的。如果任务普遍偏难,级联只是白白多了一层延迟。

和相邻概念的区别

做法大模型何时被调用成本延迟特征
全部用大模型每次每次都慢
模型路由(Routing)一开始就按问题类型分派相对稳定
模型级联小模型不确定时才升级低到中多数快,少数明显慢
集成/投票(Ensemble)并行全调,再融合答案最高最慢

路由和级联常被混着叫。粗略区分:路由是"看一眼题目就决定找谁",级联是"先试一个,不行再换"。实际系统里,路由经常就是级联的第一级判据。

对从业者的实际意义

级联的成败几乎全在升级判据上:

  • 判据太保守,什么都往上转,等于没省。
  • 判据太激进,错答会直接漏给用户——这是最贵的错误。

所以落地时先做两件事:准备一套有标准答案的评估集,量出"小模型单独能覆盖多少比例的请求";再单独量判据本身的准确率。可用的不确定信号包括模型自评置信度、多次采样的一致性、结构化输出校验、关键词或规则命中。

还要接受两个代价:尾延迟变差(最坏情况是小模型加大模型的耗时之和),以及系统复杂度上升(每一级的命中率、漏检率都得监控)。

对普通人的意义

你用到的很多产品里可能都藏着这套设计:客服机器人秒回的通常是常见问题,转人工或"正在为你仔细分析"的那一刻,往往就是级联升级。它的价值不在让 AI 更聪明,而在于让便宜的那部分算力扛住大多数日常问题,把贵的算力留给真正需要的地方。

各家模型的价格、上下文长度和版本会不断变化,具体数字以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。