跳到主内容
快讯直播
AI智模界
AI 词典

嵌入漂移:同一句话,坐标却变了

一句话定义

嵌入漂移(AI 词典:Embedding">Embedding Drift)指同一段文本,在不同时间、不同模型版本或不同运行环境下,被映射成的向量(embedding)分布发生了变化,导致原本可用的缓存、索引和相似度判断失准。

为什么会漂

嵌入模型把文本压成一串数字坐标,语义相近的文本,坐标也相近。可以把 embedding 想成图书馆给每本书贴的坐标标签:书还是那本书,但图书馆换了新的编目规则,所有坐标整体挪了位置。你拿着旧坐标去找书,要么找不到,要么找到隔壁书架。

漂移来源很多:模型升级、重新训练、微调、分词器(tokenizer)变化、向量维度或归一化方式改变、量化压缩,甚至服务端把请求路由到不同版本。文本本身没变,但它的表示变了。

和相邻概念的区别

  • 数据漂移(Data Drift):输入数据的分布变了,比如用户提问从“退货”变成“运费”。
  • 概念漂移(Concept Drift):输入和答案的关系变了,比如同样一句话,去年是正常咨询,今年是投诉。
  • 嵌入漂移:文本含义和任务关系可能都没变,只是“表示方式”变了。
概念变的是什么典型后果
数据漂移输入分布模型在新数据上效果下降
概念漂移输入到标签的映射旧规则失效
嵌入漂移向量坐标缓存命中错、检索召回掉

对从业者的实际意义

做检索增强生成(RAG)或语义缓存时,最危险的是“混用”:向量库用旧模型建索引,查询用新模型编码。同一句话的新旧向量可能不再最相似,检索会悄悄变差。缓存也一样,若缓存键只写文本、不写模型版本,模型更新后可能返回错误的相似结果。

实用做法:把模型名称和版本写进缓存键与索引元数据;模型升级时重建或双写向量;新旧索引分集合、做灰度对比;重新校准相似度阈值。对普通人来说,这解释了一个现象:同一个搜索或问答系统,某次更新后“变笨了”,未必是数据丢了,可能是背后的坐标换了。具体模型的更新与兼容策略,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。