跳到主内容
快讯直播
AI智模界
AI 词典

推理控制平面:vLLM 之外还需要的那一层

一句话定义:推理控制平面(AI 词典:Inference">Inference Control Plane)是跑在推理引擎之上的一层调度与管理软件,它决定“哪个请求、交给哪个模型副本、在哪台机器上、什么时候处理”,并让整个集群按需扩容或收缩。

先打个比方。一家餐厅,后厨(推理引擎,比如 vLLM)决定每道菜怎么做、一锅能同时炒几盘——它关心的是单个灶台的效率。但真正让餐厅不崩的,是前厅经理:谁先入座、哪桌拼台、客人点的是川菜还是粤菜该领到哪个档口、什么时候再开一个灶。推理控制平面就是这位前厅经理。

它主要干三件事:

模型路由(model routing)。对外只暴露一个统一入口,收到请求后按模型名、LoRA 适配器、租户身份、当前负载,转发到对应的副本。调用方不需要知道后端有几个实例、分别在哪。

缓存感知调度(cache-aware scheduling)。大模型推理中最贵的一步是 prefill,算出来的 KV Cache 会占显存。如果新请求和已有请求共享一段前缀——比如同一份系统提示词、同一份长文档、同一轮多路对话——把它送到已经缓存了这段前缀的副本上,就能直接跳过重复计算。控制平面会盯着各副本的缓存状态做选择,而不是简单地轮询。

多集群扩缩容(multi-cluster autoscaling)。不只在一个 Kubernetes 集群里加减 Pod,还能跨集群、跨机房调度:GPU 库存不够就换地方,延迟目标变了就调整副本分布。

它和相邻概念的区别,一张表能说清:

维度推理引擎(如 vLLM)推理控制平面
关注点单个副本内算得快不快多个副本之间分得对不对
核心对象请求队列、批处理、KV Cache 块副本、路由规则、缓存位置、集群容量
典型问题吞吐、首 token 延迟缓存命中率、负载均衡、扩缩容、多租户

顺带说清另一件事:控制平面也不是普通 API 网关。普通网关只懂 HTTP 和连接数,它不知道哪台机器上已经缓存了你这段提示词,也不理解 GPU 拓扑。

llm-d 就是按这个思路来的一个开源方案:它把 vLLM 当作推理引擎,自己负责上面的控制层——用网关式的推理路由接请求、用缓存感知的调度组件挑副本、再把扩缩容交给 Kubernetes 原生的编排体系。可以单集群起步,也能扩展到多集群。具体支持范围和部署方式,以官方页面为准。

对从业者来说,部署形态正在从“起一个 vLLM 服务”变成“搭一层控制平面”:前者决定上限,后者决定你离上限有多近。对普通职场人来说,这意味着同一个模型服务能同时接住更多人、响应更稳,GPU 的钱花在刀刃上,而不是反复算同一段已经算过的东西。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。