一句话:RAG(Retrieval-Augmented Generation,检索增强生成)就是让大模型先"查资料",再"照材料回答"。
它怎么工作
大模型的知识被压缩在参数里,像一个只凭记忆答题的考生:训练之后发生了什么、你公司的内部制度写了什么,它一概不知,却仍能流畅地编出一个听起来很对的答案。
RAG 把它拉进"开卷考场",通常分三步:
1. 建库:把文档切成语义相对完整的小段(chunk),用嵌入模型(embedding model)转成向量存进AI 词典:向量数据库">向量数据库。
2. 检索:用户提问时,把问题也转成向量,按相似度找出最相关的若干片段。
3. 生成:把这些片段连同原问题一起拼进提示词,让模型"照着材料回答"。
打个比方:面对一位学识渊博但记性有偏差的老专家,与其让他凭印象侃侃而谈,不如先递上几页相关文件——他照着文件讲,准确率立刻不一样。
为什么能减少幻觉
幻觉(hallucination)的根源是:模型没有确切知识时,仍会沿着"最像的下一句话"往下写,语气和真话一模一样。RAG 把任务从"回忆"换成了"阅读理解"——答案的依据从模糊的参数记忆,变成眼前这几段可核对的文字。
它还顺手带来两个好处:可以在提示词里要求"只依据材料作答,材料里没有就说不知道";还能把引用出处一起给出来,让人自己复核。
但它并不根治幻觉。检索没召回对的段落、文档本身过时或写错、模型没遵守"仅依据材料"的约束,都会让错误照旧发生。RAG 降低的是出错概率,不是清零。
和相邻概念的区别
| 维度 | 直接问答 | 微调(Fine-tuning) | RAG |
|---|---|---|---|
| 知识放在哪 | 模型参数里 | 模型参数里 | 外部文档库 |
| 更新方式 | 需重新训练 | 需重新训练 | 改文档即可 |
| 能否给出处 | 基本不能 | 一般不能 | 能 |
| 擅长什么 | 通用常识 | 学风格、格式、专项能力 | 私有与时效性事实 |
一句话记:微调是"改脑子",RAG 是"给资料"。两者不冲突,常一起用。
对从业者和普通人的意义
对做产品的人:不必为知识更新反复重训模型,但工程量大头落在检索侧——怎么切分、如何保证召回、要不要加重排(rerank)、怎么约束模型不乱说,这些才是效果差异的真正来源。
对普通职场人:看到 AI 回答附带来源链接,或被明确告知"资料库里没有相关内容",背后很可能就是 RAG。评价一个 AI 助手靠不靠谱,可以多问一句"这个结论的依据在哪"——能给出处、能承认不知道的,通常更值得信任。
(具体实现方案与各家产品能力差异较大,以官方文档为准。)
