Agentic RAG(智能体式检索)指的是:把检索从一道固定工序,变成模型自己可以反复调用的动作——由模型在推理过程中决定要不要查、查什么、查几轮、什么时候收手,最后再落笔回答。
传统 RAG(Retrieval-Augmented Generation,AI 词典:检索增强生成">检索增强生成)像一条流水线:问题进来,先去向量库做一次相似度检索,取回固定的若干条,塞进上下文,模型据此作答。链路是写死的,检索只发生一次,而且发生在生成之前。
打个比方:传统 RAG 像出门前在家列好书单,进图书馆一次抱走五本,不管对不对都拿这五本回来写报告。Agentic RAG 则像人真的站在书架之间——先翻两本找线索,发现关键词不对就换个词再搜;某本书里提到一篇参考文献,就顺着去追那一篇;觉得材料够了,才回到座位动笔。检索不再是前置步骤,而是贯穿思考过程的动作。
它通常包含几个环节:任务拆解(把大问题拆成子问题)、工具选择(向量检索、关键词检索、数据库查询、网页搜索可以混用)、查询改写(query rewriting)、多轮检索、结果相关性判断,以及停止条件。最后这一项最关键——不会收手,就会一直查下去。
和相邻概念的区别可以这样看:
| 维度 | 传统 RAG | Agentic RAG |
|---|---|---|
| 检索次数 | 一次,固定 | 多轮,动态 |
| 谁做决策 | 代码流程 | 模型自己 |
| 查询改写 | 通常没有 | 常见 |
| 查不到时 | 只能硬答 | 换策略、换工具再试 |
| 成本与延迟 | 低且可预测 | 高且波动大 |
| 适合的问题 | 单跳事实问答 | 多跳推理、跨源比对 |
需要说明的是,工具调用(tool / function calling)只是实现 Agentic RAG 的手段之一,它本身不等于智能体式检索——真正的分水岭是「控制流由模型决定」,而不是「模型会调 API」。
对从业者来说,重点不在把检索器做得多花哨,而在几件工程事:给循环设最大轮数和超时,给成本设上限,定义清晰的停止条件,并让每一步的检索轨迹可回放——否则线上出问题根本查不出是哪一轮跑偏了。对普通职场人来说,可以直接感受到的变化是:答案更贴题、引用更能对上问题,但等待时间更长,遇到简单问题时反而显得笨重。不是所有场景都值得上智能体,简单事实问答用传统 RAG 更快也更省。
如果你在做技术选型,建议先用传统 RAG 打底,只有当遇到明确的多跳、多源、需要反复试探的问题时,再引入 Agentic RAG。具体实现方式和可用能力,以各方案官方页面为准。
