一句话定义:在 RAG(Retrieval-Augmented Generation,AI 词典:检索增强生成">检索增强生成)评测里,忠实度衡量的是——答案里的每一个说法,是不是都能在检索回来的资料里找到依据。
打个比方:这像一场开卷考试。考生可以带参考书进场,老师判卷时除了看对不对,还看"你写的东西是不是从参考书里来的"。参考书没提"总部在北京",你写了,哪怕事实真是北京,这一笔也算夹带私货。忠实度就是这项检查。做法通常是把答案拆成一条条最小断言(claim),逐条回检索文档里找支撑,再算被支撑的比例。
典型失败有两种:一是无中生有,检索里根本没有,答案里冒出来了;二是跟检索内容打架,资料说 A,答案说非 A。它检查的对象是"答案 vs 检索内容",不是"答案 vs 客观事实"。
和相邻概念的区别:最容易和它混淆的是正确性。
| 指标 | 它在问什么 | 例子 |
|---|---|---|
| 忠实度 Faithfulness | 答案是否只依赖检索内容 | 资料只说"成立于 2010 年",答案写 2010 年 → 忠实;写 2008 年 → 不忠实;写"2010 年成立,总部在北京"而资料没提北京 → 后半句不忠实 |
| 正确性 Correctness | 答案与事实或标准答案是否一致 | 资料本身写错了年份,模型照抄:忠实但不正确 |
| 答案相关性 Answer Relevance | 答案有没有答到问题上 | 问价格,答了一堆公司历史 |
| 检索质量 Retrieval Quality | 检索回来的资料本身对不对、全不全 | 该找的文档没找到,模型再老实也答不出 |
于是会出现两种看着别扭的情况:忠实但不正确,模型老实复述了错资料;正确但不忠实,模型用自己记住的知识答对了,可用户没法从引用里验证。后者在产品里往往更危险,因为"看着对"会让人放松检查。
实际意义:做 RAG 的人,忠实度低通常说明模型在自由发挥,可优先考虑加约束(只依据资料、资料不足就说不知道)、要求给出处,或者换更听话的模型;但别拿忠实度去判断检索器好坏,那是检索质量的活。普通职场人,看到带引用的答案,先扫一眼关键说法能不能在引用里找到,找不到就当作"未验证",别因为结论顺眼就采信。评测时,忠实度、正确性、相关性一般分开报,因为它们可以各自独立翻车。具体工具如何定义和计算,以官方页面为准。
