模型热切换(Model Hot-Swap)指的是:在推理服务(inference service)不重启、不中断对外接口的前提下,把正在使用的模型权重(model weights)替换成另一个模型,并让后续请求由新模型处理。简单说,就是“边营业边换厨子”。
打个比方:一家餐厅正常营业,后厨突然要换主厨。冷做法是关门、清场、换人、再开门;热切换则像让新主厨先悄悄进后厨,熟悉灶台,等旧主厨把手上那几道菜做完,新订单再交给新主厨。顾客几乎无感,但后厨要安排好灶台、食材和出菜顺序。
技术上,模型服务通常是一个常驻进程,把权重加载到内存/显存,通过 API 对外提供推理。热切换要解决四件事:一是“双缓冲”加载,新权重先加载到另一块资源里,不干扰旧模型;二是请求路由,网关或调度器把新请求导向新模型,旧请求继续由旧模型完成;三是资源回收,旧模型没有在途请求后再卸载,释放显存/内存;四是健康检查与回滚,新模型异常时能快速切回旧模型。有些系统借助模型注册表、服务网格或容器编排的滚动更新能力来实现,具体支持程度以官方页面为准。
和相邻概念的区别:
| 概念 | 关注点 | 是否中断服务 |
|---|---|---|
| 模型热切换 | 运行时替换权重 | 追求零中断 |
| 冷重启(cold restart) | 停服务、换模型、再启动 | 会中断 |
| 滚动更新(rolling update) | 多实例逐个替换 | 通常不中断,但切换的是实例 |
| A/B 测试(A/B testing) | 流量分配策略 | 不中断,但未必替换 |
热切换是“怎么换”的机制,A/B 测试是“换多少流量”的策略,二者常配合使用。
对从业者来说,热切换让新模型上线不必挑凌晨、不必发停机公告,还能在效果不对时快速回滚,降低发布风险。对普通人来说,你用的 AI 产品更新时,聊天不会突然断线,翻译不会卡住,背后可能就有热切换在兜底。需要注意的是,新旧模型同时驻留会额外占用资源,如果服务里有会话状态或缓存,还要处理状态一致性,并非所有场景都能无脑热切。
