跳到主内容
快讯直播
AI智模界
AI 词典

记忆层:给模型塞一本可训练的随身小抄

一句话定义

记忆层(Memory Layers),也叫可学习键值记忆层,是嵌在模型内部的一张可训练的键值表(key-value table):模型在算到某一步时按需查表,只取回少量相关条目,把信息直接读进当前的内部表示里。

它怎么工作

每个位置都会生成一个查询向量(query),和记忆表里成千上万个键(key)比相似度,挑出最像的少数几条,把对应的值向量(value)加权求和,加回隐藏状态。键和值本身都是参数,跟其他权重一样靠梯度下降更新,只不过每个 token 只更新被选中的那几格,所以不同槽位能逐渐"专精"于不同类别的信息。

打个比方:普通参数像是把知识揉碎拌进脑子里——说不清存在哪,想改也难;长上下文像是把整本资料摊在书桌上,桌面有限,而且每问一次都要重读一遍;记忆层则像一个随身卡片柜,按关键词抽出几张卡片,看一眼就放回去。柜子可以做得很大(容量),但你每次只抽几张(计算量)。

和相邻概念的区别

概念存什么怎么取什么时候写入
长上下文原文 token注意力通读一遍你在对话框里贴进去
RAG外部文档块向量检索外部库随时可改
记忆层模型内部的键值向量内部相似度查表训练时学得
普通参数 / FFN隐式纠缠的知识稠密矩阵乘法训练时学得

最容易混的是 KV 缓存(KV cache):那是推理时为了不重复计算而暂存的中间结果,相当于草稿纸,不增加知识。它也不同于 MoE(混合专家):MoE 稀疏地激活若干专家网络,记忆层稀疏地读取若干记忆条目,前者是"算力路由",后者是"信息检索"。

对从业者和普通人的意义

对做模型的人,记忆层意味着"加知识"未必等于"加算力"——容量和计算被解耦了,代价主要落在显存占用和工程复杂度上,所以它常被用来替换或补充一部分前馈层(FFN)的活。

对普通职场人,体感是模型对冷门事实、专业术语、多语言词汇更"张口就来",不需要你每次都把资料塞进提示词。但要清楚:这属于训练阶段的设计选择,不是对话框里能开关的功能,具体支持情况以各家官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。