跳到主内容
快讯直播
AI智模界
AI 词典

混合检索(Hybrid Search):关键词和语义,一个都别落下

一句话定义

混合检索(Hybrid Search)是同时用「关键词检索」和「向量语义检索」两套方式去召回内容,再把双方结果合并、重新排序的一种检索策略。

两种检索各自的短板

BM25 这类关键词检索靠词频和逆文档频率打分:你搜「BM25 参数怎么调」,它能精准命中含这些词的文档。但你搜「怎么让搜索更懂人话」,它就抓瞎了——因为那篇文档里写的可能是「提升语义召回效果」,一个字都对不上。

向量检索(Vector Search)把句子压成向量,比的是「意思像不像」:搜「退款多久到账」也能命中「资金原路退回时效说明」。但它对精确字符串不敏感——产品型号、订单号、人名缩写、「C++」这类特殊符号,容易被「语义相近」的无关内容挤掉。

打个生活化的比方

就像去图书馆找书。门口站着两位管理员:一位只认书名和索引卡,你说得越准确,他翻得越快;另一位把全馆的书都读过,你说个大概他就懂你要什么。混合检索就是让两个人同时出发,最后把两份书单合并成一张。

怎么合并

难点在于两边的分数不在一个量纲上,直接相加没有意义。常见做法是排名融合(如 RRF,Reciprocal Rank Fusion),只看「排在第几名」;也可以先做分数归一化再加权。合并之后,通常还会接一个重排序(Rerank)模型,对前几十条精排一次。

维度BM25 关键词检索向量语义检索混合检索
比什么词是否出现、出现几次向量方向是否接近两者都算
擅长型号、术语、精确串口语提问、同义改写覆盖面最广
怕什么换个说法就找不到专有名词被稀释调参与工程更复杂
代价轻量、可解释需要嵌入模型和向量库两套都得维护

和相邻概念的区别

它不是 RAG(检索增强生成)的同义词。混合检索只负责「召回」这一步,RAG 是「召回 → 拼上下文 → 让大模型作答」的整条链路。重排序也不等于混合检索,它发生在合并之后,属于精排环节。

对从业者和普通人的意义

做企业知识库、电商搜索、客服问答,默认先上混合检索,通常比单用一种更稳:用户既能搜「X200 充电器」,也能搜「笔记本充不进电怎么办」。

排查问题时,把两路结果分别打开看就行:专有名词类查询表现差,多半是关键词一路权重不够;长句口语查询表现差,多半是语义一路没召回。这样就能快速判断「是没找到,还是排错了」。

具体参数与配置随各家向量库和搜索服务而不同,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。