跳到主内容
快讯直播
AI智模界
AI 词典

提示缓存(Prompt Caching):为什么重复的长前缀能便宜十倍、快好几倍

一句话定义:提示缓存(Prompt Caching)是把固定不变的长提示前缀预先算好并暂存,后续请求若前缀完全一样,就直接复用,不再从头算一遍。

原理:大模型处理请求分两步:预填充(prefill)把输入提示读进去,生成注意力所需的键值缓存(KV Cache);解码(decode)再逐字生成回答。长提示的成本和延迟主要花在 prefill。比如每次请求都带两万字产品手册、系统指令和工具说明,模型每次都要重读一遍。提示缓存像图书馆把常用参考书提前放在阅览室:只要版本、页码完全一致,下次直接取用,不必再去书库找。

缓存命中条件通常很苛刻:必须从第一个 token 起逐字一致,包括空格、换行、标点、工具定义顺序、系统消息位置等。开头一改,后面再相同也无法复用。缓存一般有存活时间(TTL),过期后需重新写入。不同平台对写入、读取、最小长度和过期策略的计费规则不同,具体以官方页面为准。

与相邻概念的区别:KV Cache 常指单次生成中缓存已算过的 token,让后续 token 不必重算;提示缓存是把这类缓存跨请求保留。语义缓存(Semantic Cache)按问题相似度直接返回旧答案,可能不调用模型;提示缓存只复用计算,不跳过生成,回答仍结合新问题实时生成。RAG 负责“找资料”,提示缓存负责“别重复读同一段资料”。

实际意义:对从业者,把稳定内容放前面——系统指令、few-shot 示例、工具 schema、固定文档、代码库摘要;把用户问题、时间戳、随机 ID 放后面。重复调用时,输入侧成本和首字延迟都会明显下降,长前缀场景下常能便宜数倍甚至一个数量级、快好几倍。对普通职场人,体感是同一个长文档反复问答、同一个角色反复对话,等待更短、账单更低。但它不改变模型能力,也不会让不同问题共享答案;它省的是重复计算的冤枉钱。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。