跳到主内容
快讯直播
AI智模界
AI 词典

幻觉(Hallucination):它不是「说谎」,是概率机器的必然副产品

一句话定义:幻觉(Hallucination)指大语言模型生成读起来通顺、格式漂亮,但内容与事实不符、或干脆是凭空捏造的输出——重点是,模型并不知道自己在编。

原理:一台只会算「下一句最像什么」的机器

模型本质上是一个逐词预测的概率机器。它每次只做一件事:根据上文,算出下一个 token 最可能是什么。它被优化的目标是「这段话像不像真实语料」,而不是「这段话是不是真的」。

打个比方:一个从没去过现场的美术生,凭看过的大量画作,能补出一幅看不出破绽的风景——笔触是对的,色调是对的,但画里那座山不存在。它不是要骗你,它只是把「最像的样子」填了上去。因为在概率的世界里,空白必须被填满。

这解释了为什么幻觉是必然副产品:模型没有「我不知道」的默认档位。遇到训练里稀薄的领域,它输出的仍是最流畅的那条路径。再加上解码时的随机采样,同一个问题问两次,可能一次对、一次编。

和相邻概念的区别

概念有真相对照吗有意图吗典型表现
幻觉没有没有假引用、假数字、不存在的条款
说谎知道真相故意给出错误信息
知识过时学到的是旧的没有输出已失效的信息
措辞波动事实不变没有换个说法讲同一件事

关键差别在「意图」和「自我觉察」:说谎的人心里有本账,幻觉连账都没有。

对从业者的意义

别把模型当数据库。常见做法是用 RAG(Retrieval-Augmented Generation,检索增强生成)先把原文捞出来,再让它基于原文回答;要求它标注出处;在提示里明确授权它说「不知道」;关键环节加规则校验、结构化输出或人工复核。评估时专门造一批「没有答案」的题,看它是老实摇头,还是硬编。

对普通人的意义

把它当成口才极好、但偶尔一本正经胡说的实习生。凡是人名、数字、日期、法条、链接,都回到原始来源核对一遍,具体以官方页面为准。让它「标出不确定的地方」能降低概率,但降不到零。

幻觉不会因为模型变大而消失,只会变少、变得更难被发现。能不能放心用,取决于你有没有为核对留出成本。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。