跳到主内容
快讯直播
AI智模界
AI 词典

智能体记忆(Agent Memory):短期、长期、向量到底怎么分

一句话定义

智能体记忆(Agent Memory)是智能体(Agent)把交互中产生的信息存下来、需要时再取回来的能力,让它在多轮甚至跨会话的协作中不必每次从零开始。

打个比方

把智能体想成一个新来的助理。

开会时他桌上摊着一张白板纸,写着这次会议要点,会开完就撕掉——这是短期记忆。他另有一本工作笔记,记着「老板喜欢先看结论」「A 项目对接人是老张」,下次你再来他翻笔记——这是长期记忆。这笔记不按页码索引,而按「意思」索引:你说「上次那个预算的事」,他能翻到对应那页,实现这种「按意思找」的常用技术就是向量记忆

三者不在同一个维度上

这是最容易混淆的一点:

  • 短期记忆(short-term memory)与长期记忆(long-term memory)是按活多久划分的。
  • 向量记忆(vector memory)是按怎么存、怎么取划分的。

短期记忆的物理载体是上下文窗口(context window),随对话变长会被截断或压缩成摘要。长期记忆存在模型之外,通常是数据库或文件,跨会话保留。向量记忆是长期记忆最常见的实现之一:把内容切块,用嵌入模型(embedding model)转成向量存进向量库,检索时按语义相似度召回,再塞回上下文。所以向量记忆是长期记忆的一种实现手段,和短期记忆并非并列关系。

短期记忆长期记忆向量记忆
划分依据存活时间存活时间存取方式
存在哪上下文窗口外部存储向量库
典型寿命当前会话/任务跨会话看它承载什么
怎么取回全文直接读按 ID、关键词、条件查按语义相似度召回
主要瓶颈窗口容量与成本写什么、何时更新召回不准、难解释

长期记忆内部还常再分两类:事实型(用户偏好、组织规则)和事件型(上次聊了什么、做了什么决定)。前者相对稳定,后者有时效性。

和相邻概念的区别

和检索增强生成(RAG)比:RAG 通常指从外部知识库取资料,记忆更偏「智能体自己攒下的信息」。两者技术高度重叠,很多实现里记忆就是一种带写入的 RAG,差别在数据从哪来、何时写进去。

和微调(fine-tuning)比:微调把知识写进模型权重,更新慢、成本高;记忆是外挂的,随时能增删改。相当于给模型配个笔记本,而不是让它重新上学。

对实际工作的意义

1. 记忆不只是「把上下文堆大」。堆得越多,成本和注意力稀释越明显,该落库的要落库。

2. 难点在策略:什么值得写、何时写、检索几条、怎么拼进提示词。

3. 必须设计遗忘与覆盖。用户改了偏好、项目结了项,旧记忆要能失效,否则它会一直按老信息办事。

4. 长期记忆里多是用户信息,存哪、怎么删、谁能看,要提前想清楚。具体实现以各家官方文档为准。

对普通用户来说,「AI 记得我上次说过什么」背后就是这套机制;它偶尔忘事或记错,往往不是模型笨,而是没写进去、没检索到,或者检索到了不相干的内容。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。