跳到主内容
快讯直播
AI智模界
AI 词典

Cache-to-Cache:模型之间不走文本,直接传缓存

一句话定义

Cache-to-Cache(C2C,跨模型缓存语义直传)是一种让两个大语言模型(LLM)绕开文本、把各自的 KV 缓存(Key-Value Cache)里承载的语义状态直接传给对方的通信方式。

先搞清 KV 缓存是什么

LLM 每生成一个字,都要先“读一遍”前面全部内容。为了不重复读,推理引擎会把每一层算好的注意力中间结果——键(Key)和值(Value)——存下来,这就是 KV 缓存。它相当于模型读文章时做的读书笔记:下次用到同一段前缀,直接翻笔记,不必重读。

C2C 和普通缓存复用差在哪

普通 KV 缓存复用有三个前提:同一个模型、同一段 token、同一套推理引擎。比如AI 词典:系统提示词">系统提示词固定,或同一份长文档被反复提问,缓存就能一直吃下去。

C2C 把范围推进到“不同模型之间”:A 模型算完的缓存,直接喂给 B 模型当输入。

为什么难

不同模型的层数、隐藏维度、注意力头数都不一样,缓存张量的形状和数值含义对不上。所以 C2C 中间必须垫一层“翻译器”,把 A 的缓存投影进 B 的表示空间。常见做法是训练一个轻量映射模块,用成对文本让 A 的缓存学着对齐 B 的缓存。

打个比方:A 用速记符号写笔记,B 只认自己那套符号,直接递过去没用,得先有个翻译把速记转成 B 能读的形式。

能省掉哪部分计算

省掉的是 B 的预填充(prefill)阶段——B 不必再把 A 输出的那段文本重新分词、重算一遍注意力。在多智能体(multi-agent)流水线里,这一步常常最费时间,上游输出越长越明显。

还有一笔隐性收益是信息保真度:文本是压缩过的,A 的不确定性和上下文结构在写成字的那一刻就丢了不少,缓存里保留的状态要丰富得多。

和相邻概念的区别

概念层级是否跨模型复用条件
KV Cache 复用缓存前缀 token 完全一致
Prefix Caching缓存共享公共前缀
蒸馏 / 微调参数需要大量训练数据
C2C缓存需表示空间对齐

对从业者的实际意义

如果你在做多智能体、级联推理(cascade),或“小模型打底、大模型兜底”的路由架构,C2C 指出了一个方向:模型之间的接口不一定是文本。文本是给人看的中间格式,机器之间本可以走更密的通道。

但边界也要清楚。缓存体积通常比文本大得多,跨进程、跨机器传输本身要带宽;映射模块的精度直接决定下游质量,对不齐就是噪声;这套机制还和具体推理引擎、模型版本强绑定,不像文本接口那样即插即用。它目前更偏研究阶段的方向,工程上能落到什么程度,要看各家推理框架的实际支持,以官方页面为准。

对普通职场人的启示反而简单:多智能体系统里“传话”的成本常被低估,C2C 想省的就是这笔账。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。