一句话定义:模型路由(Model Routing)是在请求进入系统的那一刻,自动决定用哪一档模型来作答——是秒回的轻量档,还是慢一点但更会想事情的推理档——并在模型出错、限流或答得不够好时切换到备选模型。
打个比方:分诊台
走进急诊室,护士不会让所有人都去做 CT。量个体温、问两句,感冒的去普通门诊,胸痛的直接推进抢救室。模型路由就是 AI 系统里的分诊台。
常见的档位大致是这几层:极轻量档(常叫 nano、Instant 之类)、通用主力档(mini 一类)、擅长多步推理的推理型(reasoning)档、以及最强的前沿型(frontier)档。同一句话,交给不同档位,成本、延迟、质量能差出好几个量级。
分诊的依据通常是:任务类型(改写、抽取、翻译,还是写代码、做多步数学推理)、输入长度与上下文规模、是否需要调用工具、用户的套餐档位、以及对延迟的要求(比如自动补全这类场景等不起)。
两种主流做法
一是先分类。 用一个便宜的小模型或分类器给请求打标签,判定它属于哪一档,再转发过去。
二是级联加回退(cascade + fallback)。 先让最便宜最快的模型答;用置信度、自检或一个验证器判断它答得靠不靠谱,靠谱就交付,不靠谱再升级到更强的档位。这条链子往回走,就是“回退”:某档模型超时、限流、报错时,自动切到同档或更高档的备选。
和相邻概念的区别
| 决策粒度 | 隐含假设 | 目标 | |
|---|---|---|---|
| 模型路由 | 一次请求(有时是会话中的某一轮) | 各档模型能力、价格、速度差别巨大 | 在质量、成本、延迟之间取平衡 |
| 负载均衡(Load Balancing) | 一次请求或连接 | 各后端能力基本等价 | 摊平流量、避免单点过载 |
| 混合专家(MoE) | 一次前向计算中的 token 或层 | 同一模型内部专家各有所长 | 用更少算力换取更大参数量 |
负载均衡是“把活平均分”,它默认后端都一样强;路由是“把活分给对的人”,它默认大家不一样强。至于 MoE,路由发生在模型身体内部,普通人看不见;模型路由发生在系统调度层,跨的是不同模型。
对从业者和普通人的意义
对做产品的人来说,路由往往是成本与体验的最大杠杆。真实流量里,大部分请求是简单问答,只有少数需要重推理。全都走最贵的档,账单会很难看;全都走最便宜的档,用户会觉得“这产品不太行”。要管好它,得能度量:每一档的准确率、尾部延迟、失败率、单位请求成本;还要有离线评测集和灰度机制,别让“判断该不该升级”这一步自己变成瓶颈。分诊判错是双向伤害——简单题被塞进推理档,用户白等;难题被留在小模型上,它会自信地答错。
对普通人来说,你感觉到的“同一个产品有时很快有时很慢、有时聪明有时犯傻”,很可能就是路由在工作。界面上那个“快速模式 / 深度思考”的开关,本质是把路由权临时交给你。至于各家具体怎么分档、命名为何、限额多少,以官方页面为准。
