一句话定义:Serverless GPU(无服务器 GPU)是一种按实际使用时长计费、无需自己运维的 GPU 算力租用方式——提交任务,平台分一块 GPU 给你用,用完就还回去。
“无服务器”不是真的没有服务器,而是没有你要负责的服务器。机器仍然在机房里,只是调度、扩缩容、打补丁这些活都由平台干了。
打个比方:它像共享自习室——不用自己租一整层楼、买桌椅、交全年物业费,进门刷卡按分钟算,走人就走人。代价是,从门口走到座位上要花点时间:刷卡、找空位、开灯、把电脑掏出来。冷启动(cold start)那几秒到几十秒,干的就是这几件事:
1. 找机器:调度器在集群里挑一台有空闲 GPU 的节点。
2. 拉镜像:把容器镜像(image)下载到那台机器上。带 CUDA 和深度学习框架的镜像动辄几个 GB,这一步往往最耗时。
3. 起容器、初始化运行时:启动进程,建立 CUDA context,和 GPU 驱动、通信库打交道。
4. 加载权重:把模型参数从磁盘或对象存储读出来,经 PCIe 搬进显存。
5. 预热:跑一次前向计算,触发算子编译和显存分配,免得第一次真实请求慢得离谱。
平台常用“预热池”提前备好常用镜像和运行时,让部分步骤在请求到来前完成。具体耗时各家差别很大,以官方页面为准。
一笔必须算的账:冷启动期间算不算计费,各平台策略不同,选型时要问清楚。如果任务长期跑满 GPU,Serverless 反而更贵;任务稀疏、突发多,它才划算。
| 维度 | Serverless GPU | 独占 GPU 云主机 | 自建集群 |
|---|---|---|---|
| 计费 | 按秒/毫秒,用完即停 | 按小时或包月,闲置也付 | 采购加运维 |
| 冷启动 | 秒级到几十秒 | 开机慢,之后常驻 | 最快 |
| 运维负担 | 几乎为零 | 要管系统与驱动 | 全部自己扛 |
| 适合场景 | 突发推理、批处理、Notebook | 稳定长跑的训练与服务 | 长期满载的大规模业务 |
对从业者:它把“按需付费”推到了 GPU 这种稀缺资源上,适合模型不大、请求稀疏、任务突发的场景。选型时重点看三点:冷启动多长、怎么计费、有没有保活或预热机制。延迟敏感的服务,要提前配好预热策略和降级方案。
对普通职场人:你用的修图、转写、生成周报等 AI 功能,后端可能就跑在 Serverless GPU 上。它把“偶尔用一次 AI”的成本从包月变成按次,也解释了为什么有些工具高峰期要转几秒——那不是模型在思考,而是在等一台机器把水烧开。
