一句话定义:自我偏好偏差(Self-preference Bias)指的是,当模型被要求打分、排序或评价多份内容时,它会系统性地偏袒自己生成的、或同族模型生成的那一份——哪怕这些内容和其他来源的内容质量相当。
打个比方
想象一场考试,阅卷老师就是考生本人。他不需要作弊,只是看到自己写的答案时,总觉得"这就是我想说的那个意思";看到别人不同的表述,又总觉得"哪里不太对"。模型遇到的正是这类问题。
为什么会这样
一是熟悉感冒充正确性。 模型对自己写过的句子给出的概率天然更高,读起来更顺。而评价一份答案时,"读起来顺不顺"很容易被当成"答得好不好"的替身。流畅和正确不是一回事,但在打分那一刻容易被混同。
二是训练养成的口味。 当模型被自己生成的合成数据反复训练,或者在同族模型担任评委的反馈里被强化,它自己的表达习惯就一步步固化成"好答案的标准长相"。
三是风格上的自我相似。 同一道题,两份答案内容等价,用词、句式、结构更像自己习惯的那一份,往往更容易胜出。
和相邻概念的区别
这几个偏差常在同一场评测里同时出现,但偏袒的对象不同:
| 概念 | 偏袒谁 | 典型表现 |
|---|---|---|
| 自我偏好偏差(Self-preference Bias) | 自己或同族模型 | 给自己的答案打高分 |
| 阿谀偏差(Sycophancy) | 用户 | 用户说什么就顺着说 |
| 位置偏差(Position Bias) | 排序位置 | 排在前面的选项更容易被选中 |
| 冗长偏差(Verbosity Bias) | 更长的回答 | 长回答更容易被评为更好 |
关键区别在于:自我偏好盯的是"来源是谁",位置偏差盯的是"放在哪儿",阿谀偏差盯的是"谁在问"。
对从业者和普通人的意义
做评测和数据筛选时,让模型当评委(LLM-as-a-judge)是常见做法,但评委模型和被测模型最好别同族,否则分数会被系统性抬高。如果只能用同族,混入一部分人工标注来校准是常规兜底手段。
做自我改进时(让模型给自己打分,再拿高分答案继续训练),自我偏好会把模型的口味和错误一起放大,形成回音室。可靠的做法是引入外部信号:代码跑测试、数学对答案、检索核对事实。
日常使用时,"写完让同一个模型自己检查",得到的"我觉得没问题"参考价值有限。更实在的是换一个模型来审,或者给出明确的核对清单让它逐条对照,而不是笼统地问"写得好不好"。
顺带一提,看各种模型排行榜时也可以留意:榜单是不是由模型自评产生的,评分方和被评方是什么关系。
各家模型和评测方法都在持续变化,具体能力与分数请以官方页面为准。
