一句话定义
智能体记忆(Agent Memory)是智能体(Agent)把交互中产生的信息存下来、需要时再取回来的能力,让它在多轮甚至跨会话的协作中不必每次从零开始。
打个比方
把智能体想成一个新来的助理。
开会时他桌上摊着一张白板纸,写着这次会议要点,会开完就撕掉——这是短期记忆。他另有一本工作笔记,记着「老板喜欢先看结论」「A 项目对接人是老张」,下次你再来他翻笔记——这是长期记忆。这笔记不按页码索引,而按「意思」索引:你说「上次那个预算的事」,他能翻到对应那页,实现这种「按意思找」的常用技术就是向量记忆。
三者不在同一个维度上
这是最容易混淆的一点:
- 短期记忆(short-term memory)与长期记忆(long-term memory)是按活多久划分的。
- 向量记忆(vector memory)是按怎么存、怎么取划分的。
短期记忆的物理载体是上下文窗口(context window),随对话变长会被截断或压缩成摘要。长期记忆存在模型之外,通常是数据库或文件,跨会话保留。向量记忆是长期记忆最常见的实现之一:把内容切块,用嵌入模型(embedding model)转成向量存进向量库,检索时按语义相似度召回,再塞回上下文。所以向量记忆是长期记忆的一种实现手段,和短期记忆并非并列关系。
| 短期记忆 | 长期记忆 | 向量记忆 | |
|---|---|---|---|
| 划分依据 | 存活时间 | 存活时间 | 存取方式 |
| 存在哪 | 上下文窗口 | 外部存储 | 向量库 |
| 典型寿命 | 当前会话/任务 | 跨会话 | 看它承载什么 |
| 怎么取回 | 全文直接读 | 按 ID、关键词、条件查 | 按语义相似度召回 |
| 主要瓶颈 | 窗口容量与成本 | 写什么、何时更新 | 召回不准、难解释 |
长期记忆内部还常再分两类:事实型(用户偏好、组织规则)和事件型(上次聊了什么、做了什么决定)。前者相对稳定,后者有时效性。
和相邻概念的区别
和检索增强生成(RAG)比:RAG 通常指从外部知识库取资料,记忆更偏「智能体自己攒下的信息」。两者技术高度重叠,很多实现里记忆就是一种带写入的 RAG,差别在数据从哪来、何时写进去。
和微调(fine-tuning)比:微调把知识写进模型权重,更新慢、成本高;记忆是外挂的,随时能增删改。相当于给模型配个笔记本,而不是让它重新上学。
对实际工作的意义
1. 记忆不只是「把上下文堆大」。堆得越多,成本和注意力稀释越明显,该落库的要落库。
2. 难点在策略:什么值得写、何时写、检索几条、怎么拼进提示词。
3. 必须设计遗忘与覆盖。用户改了偏好、项目结了项,旧记忆要能失效,否则它会一直按老信息办事。
4. 长期记忆里多是用户信息,存哪、怎么删、谁能看,要提前想清楚。具体实现以各家官方文档为准。
对普通用户来说,「AI 记得我上次说过什么」背后就是这套机制;它偶尔忘事或记错,往往不是模型笨,而是没写进去、没检索到,或者检索到了不相干的内容。
