跳到主内容
快讯直播
AI智模界
AI 词典

Fallback(降级兜底):主模型挂了,服务也不能挂

一句话定义:Fallback 指的是当主模型或主链路不可用时,系统自动切到一套备用方案,让请求仍然返回一个"够用"的结果,而不是直接报错。

它解决的是一类很常见的问题:模型会超时、会被限流、会返回 5xx 错误,极端情况下整条服务都不可用。用户并不关心是哪一层出了问题,他只想拿到答案。所以成熟的 AI 服务会准备一条"阶梯":先试主模型;失败就重试一两次;再不行换一个同级备用模型;还不行换更小更快的模型,牺牲一点质量换响应;仍然不行就退到规则、缓存或模板话术。

打个比方:电梯坏了走楼梯,高铁停运改签下一班,招牌菜卖完了服务员推荐替代菜——实在不行先上一碗面,总比让你饿着强。Fallback 就是这个"先上一碗面"的机制。

做 Fallback 有几个容易踩的坑。一是必须有超时预算(timeout budget):整条链路总共只有几秒,不能每个备用方案都干等三十秒。二是要学会熔断(circuit breaker):某个上游连续报错时,直接快速失败,别把线程全堆在那儿。三是警惕降级风暴:主模型一挂,流量瞬间砸到备用模型上,备用模型也被打垮,这时限流(rate limit)和排队就是必要的。四是降级最好留痕——日志里标清楚用了哪条路径,否则质量悄悄下滑,你只会看到"最近回答变笨了"却查不出原因。

它和几个邻居概念的区别:

概念触发后做什么关键点
重试 Retry同一个目标再发一次只治偶发抖动,次数要克制
降级 Fallback换模型、换通道或换兜底话术保证"有结果"优先于"最优结果"
熔断 Circuit Breaker直接不调用,快速失败防止被拖垮,给自己留恢复时间
缓存 Cache返回之前算过的结果快,但可能过时
限流 Rate Limit挡住过多请求保护上游和自己

对从业者来说,降级路径应该和主路径一样被当成正式功能来设计、测试和演练:压测时故意把主模型打挂,看备用链路能不能接住,接住的结果质量如何,用户能不能感知。对普通职场人来说,你遇到"当前请求较多,已为你切换到精简模式",或者回答明显简短了一些,往往就是它在工作。它不制造惊喜,只负责不让体验断崖。具体阈值、超时时间、备用模型清单,以各家产品的官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。