一句话定义:搜索后综合(Post-Search Synthesis)指的是智能体检索到多份资料之后,把这些材料筛选、比对、消解冲突,最终组织成一份连贯答案的过程。检索(retrieval)负责把材料抱回来,综合负责把材料变成判断。
打个比方。让实习生查一件事,他抱回一摞打印件,只算完成一半。真正难的是:哪几份可信,两份材料的数字对不上听谁的,有没有互相抄的二手信息,最后怎么用一页纸说清楚。检索是体力活,综合是判断力活。
为什么难。
- 冲突消解:来源之间常有矛盾,原因可能是口径、时间或适用场景不同,得判断,不能简单取多数。
- 覆盖与取舍:漏掉关键来源,结论就偏;什么都往里塞,答案又没重点。
- 归因:每句结论要能指回具体来源,否则读者无从核查。
- 长上下文:材料一起塞进上下文后,中间部分容易被忽略,靠后的证据常常白捡。
- 组织与呈现:读者要的是有结构的判断,不是把几段摘要首尾拼起来。
和相邻概念的区别。检索是"找出来";AI 词典:检索增强生成">检索增强生成(RAG,Retrieval-Augmented Generation)是"找出来再拼进提示词生成"。RAG 本身也包含综合,只是实践中常被简化成"片段堆叠"。搜索后综合强调的是多来源、多轮次、要消解冲突、要给出带引用的结构化判断。
| 环节 | 主要动作 | 交付物 |
|---|---|---|
| 检索 | 找出相关片段 | 一串文档 |
| 简化的 RAG | 片段拼进上下文直接生成 | 一段答案 |
| 搜索后综合 | 比对、消解冲突、结构化 | 带引用、带判断的结论 |
怎么评测它。公开基准大致从三个角度切:答案对不对(与参考答案比对,用模型当裁判或人工打分)、覆盖全不全(关键点命中率)、引用实不实(每个论断能否被给出的来源支撑)。难点在于综合类任务常常没有唯一正确答案,开放式写作很难自动打分,所以不少基准退回到有明确事实答案的短问答,反而测不到真正的冲突消解与组织能力。看结果时要留意题目形式是不是真在测这一环,具体口径以官方页面为准。
对从业者的意义。优化别只盯召回率,检索质量再高,综合垮了答案照样不能用。值得投入的是流程:先把问题拆成子问题,分批检索,把证据单独记下来再做综合,并明确要求模型标出冲突和不确定。
对普通人的意义。看 AI 给的带引用报告,别只看结论顺不顺。抽查一两句,点开来源确认它是否真的支撑那句话,尤其注意它有没有把互相打架的材料悄悄抹平。
