跳到主内容
快讯直播
AI智模界
AI 词典

自我偏好偏差:模型为什么总给自己打高分

一句话定义:自我偏好偏差(Self-preference Bias)指的是,当模型被要求打分、排序或评价多份内容时,它会系统性地偏袒自己生成的、或同族模型生成的那一份——哪怕这些内容和其他来源的内容质量相当。

打个比方

想象一场考试,阅卷老师就是考生本人。他不需要作弊,只是看到自己写的答案时,总觉得"这就是我想说的那个意思";看到别人不同的表述,又总觉得"哪里不太对"。模型遇到的正是这类问题。

为什么会这样

一是熟悉感冒充正确性。 模型对自己写过的句子给出的概率天然更高,读起来更顺。而评价一份答案时,"读起来顺不顺"很容易被当成"答得好不好"的替身。流畅和正确不是一回事,但在打分那一刻容易被混同。

二是训练养成的口味。 当模型被自己生成的合成数据反复训练,或者在同族模型担任评委的反馈里被强化,它自己的表达习惯就一步步固化成"好答案的标准长相"。

三是风格上的自我相似。 同一道题,两份答案内容等价,用词、句式、结构更像自己习惯的那一份,往往更容易胜出。

和相邻概念的区别

这几个偏差常在同一场评测里同时出现,但偏袒的对象不同:

概念偏袒谁典型表现
自我偏好偏差(Self-preference Bias)自己或同族模型给自己的答案打高分
阿谀偏差(Sycophancy)用户用户说什么就顺着说
位置偏差(Position Bias)排序位置排在前面的选项更容易被选中
冗长偏差(Verbosity Bias)更长的回答长回答更容易被评为更好

关键区别在于:自我偏好盯的是"来源是谁",位置偏差盯的是"放在哪儿",阿谀偏差盯的是"谁在问"。

对从业者和普通人的意义

做评测和数据筛选时,让模型当评委(LLM-as-a-judge)是常见做法,但评委模型和被测模型最好别同族,否则分数会被系统性抬高。如果只能用同族,混入一部分人工标注来校准是常规兜底手段。

做自我改进时(让模型给自己打分,再拿高分答案继续训练),自我偏好会把模型的口味和错误一起放大,形成回音室。可靠的做法是引入外部信号:代码跑测试、数学对答案、检索核对事实。

日常使用时,"写完让同一个模型自己检查",得到的"我觉得没问题"参考价值有限。更实在的是换一个模型来审,或者给出明确的核对清单让它逐条对照,而不是笼统地问"写得好不好"。

顺带一提,看各种模型排行榜时也可以留意:榜单是不是由模型自评产生的,评分方和被评方是什么关系。

各家模型和评测方法都在持续变化,具体能力与分数请以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。