一句话定义:检索器微调(Retriever AI 词典:Fine-tuning">Fine-tuning)就是用你自己业务里「问题 → 正确原文」的配对数据,把负责把文本转成向量(Embedding)的那个模型再训练一遍,让它更擅长把你的问题匹配到你的文档。
为什么通用向量模型在你的领域会「找不到」
RAG(Retrieval-Augmented Generation,检索增强生成)的流程一般分两段:检索器从知识库里捞出候选段落,生成模型读完候选再写答案。检索器的底座是一个 Embedding 模型,它把每段文本压成一串数字向量,靠向量之间的距离判断两段话「像不像」。
通用向量模型是在互联网大杂烩上训练的,它学到的「像」是大众语义的像。问题在于,每个行业、每家公司都有自己的黑话。
举个具体例子。某硬件公司的客服工单里,用户搜「设备一直不在线怎么办」,通用模型会去找「网络连接」「断网排查」这类字面相近的段落;而真正该命中的那条写的是「SIM 卡余额不足导致心跳中断」——两者字面几乎不重叠,通用模型认为它们不像,正确文档就沉在库里捞不上来。反过来,它可能把医疗语境里的「心跳」当成技术文档里的「心跳」,因为它在公开语料里见得更多的是前者。
打个比方:通用 Embedding 模型像一个什么书都读过的图书管理员,你问「咱们组那个卡住的项目」,他真不知道你说的「卡住」指的是测试环境挂了。
怎么训
不需要海量标注。常见做法是拿已有的用户提问,配上人工确认过的正确文档片段作为正样本,同一批问题里的其它文档当负样本,用对比学习(contrastive learning)把正样本拉近、负样本推远。数据可以从几百条起步,也可以先让大模型基于你的文档批量出题再人工筛。具体需要多少数据、能提升多少,取决于你的领域偏离通用语料的程度,以实际评测结果为准。
和相邻概念的区别
| 检索器微调 | 重排器微调 | 生成模型微调 | |
|---|---|---|---|
| 作用阶段 | 召回 | 精排 | 写作 |
| 输入形态 | 单段文本 | 问题+文档对 | 提示+答案 |
| 解决的问题 | 正确文档进不了候选池 | 候选排序不对 | 答案风格、格式不对 |
| 典型底座 | 双塔 Embedding 模型 | 交叉编码器(Cross-encoder) | 大语言模型 |
对你意味着什么
做 RAG 的从业者,先做错误归因再决定动哪一层:如果正确文档压根没进 Top-K,那是召回问题,微调检索器值得做;如果它在候选里但排在第 8 位被截断,先调大 K 或者加个重排器(Reranker)更划算。改提示词改的是生成模型怎么读,救不了召回。此外,关键词检索(如 BM25)和向量检索混合使用,往往比单纯微调更省事。
对普通职场人,这条词条的实用价值是:内部搜索不好用,不一定是搜索框的问题,也可能是底层的向量模型从没学过你们公司的黑话。至于某个模型能不能微调、接口怎么调,以各家官方文档为准。
