一句话定义
嵌入漂移(AI 词典:Embedding">Embedding Drift)指同一段文本,在不同时间、不同模型版本或不同运行环境下,被映射成的向量(embedding)分布发生了变化,导致原本可用的缓存、索引和相似度判断失准。
为什么会漂
嵌入模型把文本压成一串数字坐标,语义相近的文本,坐标也相近。可以把 embedding 想成图书馆给每本书贴的坐标标签:书还是那本书,但图书馆换了新的编目规则,所有坐标整体挪了位置。你拿着旧坐标去找书,要么找不到,要么找到隔壁书架。
漂移来源很多:模型升级、重新训练、微调、分词器(tokenizer)变化、向量维度或归一化方式改变、量化压缩,甚至服务端把请求路由到不同版本。文本本身没变,但它的表示变了。
和相邻概念的区别
- 数据漂移(Data Drift):输入数据的分布变了,比如用户提问从“退货”变成“运费”。
- 概念漂移(Concept Drift):输入和答案的关系变了,比如同样一句话,去年是正常咨询,今年是投诉。
- 嵌入漂移:文本含义和任务关系可能都没变,只是“表示方式”变了。
| 概念 | 变的是什么 | 典型后果 |
|---|---|---|
| 数据漂移 | 输入分布 | 模型在新数据上效果下降 |
| 概念漂移 | 输入到标签的映射 | 旧规则失效 |
| 嵌入漂移 | 向量坐标 | 缓存命中错、检索召回掉 |
对从业者的实际意义
做检索增强生成(RAG)或语义缓存时,最危险的是“混用”:向量库用旧模型建索引,查询用新模型编码。同一句话的新旧向量可能不再最相似,检索会悄悄变差。缓存也一样,若缓存键只写文本、不写模型版本,模型更新后可能返回错误的相似结果。
实用做法:把模型名称和版本写进缓存键与索引元数据;模型升级时重建或双写向量;新旧索引分集合、做灰度对比;重新校准相似度阈值。对普通人来说,这解释了一个现象:同一个搜索或问答系统,某次更新后“变笨了”,未必是数据丢了,可能是背后的坐标换了。具体模型的更新与兼容策略,以官方页面为准。
