跳到主内容
快讯直播
AI智模界
AI 词典

检索器微调:让向量模型听懂你们公司的黑话

一句话定义:检索器微调(Retriever AI 词典:Fine-tuning">Fine-tuning)就是用你自己业务里「问题 → 正确原文」的配对数据,把负责把文本转成向量(Embedding)的那个模型再训练一遍,让它更擅长把你的问题匹配到你的文档。

为什么通用向量模型在你的领域会「找不到」

RAG(Retrieval-Augmented Generation,检索增强生成)的流程一般分两段:检索器从知识库里捞出候选段落,生成模型读完候选再写答案。检索器的底座是一个 Embedding 模型,它把每段文本压成一串数字向量,靠向量之间的距离判断两段话「像不像」。

通用向量模型是在互联网大杂烩上训练的,它学到的「像」是大众语义的像。问题在于,每个行业、每家公司都有自己的黑话。

举个具体例子。某硬件公司的客服工单里,用户搜「设备一直不在线怎么办」,通用模型会去找「网络连接」「断网排查」这类字面相近的段落;而真正该命中的那条写的是「SIM 卡余额不足导致心跳中断」——两者字面几乎不重叠,通用模型认为它们不像,正确文档就沉在库里捞不上来。反过来,它可能把医疗语境里的「心跳」当成技术文档里的「心跳」,因为它在公开语料里见得更多的是前者。

打个比方:通用 Embedding 模型像一个什么书都读过的图书管理员,你问「咱们组那个卡住的项目」,他真不知道你说的「卡住」指的是测试环境挂了。

怎么训

不需要海量标注。常见做法是拿已有的用户提问,配上人工确认过的正确文档片段作为正样本,同一批问题里的其它文档当负样本,用对比学习(contrastive learning)把正样本拉近、负样本推远。数据可以从几百条起步,也可以先让大模型基于你的文档批量出题再人工筛。具体需要多少数据、能提升多少,取决于你的领域偏离通用语料的程度,以实际评测结果为准。

和相邻概念的区别

检索器微调重排器微调生成模型微调
作用阶段召回精排写作
输入形态单段文本问题+文档对提示+答案
解决的问题正确文档进不了候选池候选排序不对答案风格、格式不对
典型底座双塔 Embedding 模型交叉编码器(Cross-encoder)大语言模型

对你意味着什么

做 RAG 的从业者,先做错误归因再决定动哪一层:如果正确文档压根没进 Top-K,那是召回问题,微调检索器值得做;如果它在候选里但排在第 8 位被截断,先调大 K 或者加个重排器(Reranker)更划算。改提示词改的是生成模型怎么读,救不了召回。此外,关键词检索(如 BM25)和向量检索混合使用,往往比单纯微调更省事。

对普通职场人,这条词条的实用价值是:内部搜索不好用,不一定是搜索框的问题,也可能是底层的向量模型从没学过你们公司的黑话。至于某个模型能不能微调、接口怎么调,以各家官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。