一句话定义:在模型评测或偏好训练中,评分方(人或另一个模型)系统性地给更长的回答打更高分,即使它并不更准确、更切题。
它从哪来
人类是第一个源头。面对两个答案,一个三行、一个三十行,三十行的看起来"更认真、更全面、更努力",哪怕它只是把同一句话换着说法重复。标注员写偏好数据时,这种直觉会被原样写进数据集。
第二个源头是模型评委。用大模型给回答打分时,它从人类偏好数据里学到了同样的口味。长回答里包含更多"看起来正确"的表述,更容易命中评审的模糊标准。于是形成循环:训练时奖励模型(reward model)偏长 → 策略模型学会凑字数 → 新一轮数据里长回答又获胜。
打个比方
像作文阅卷。两篇作文思路一样,一篇写满两页,一篇只有半页。老师即便嘴上说"只看内容",手上还是容易给写满的那篇多一分"态度分"。时间一长,学生全学会了把话说长。
容易混淆的几个概念
| 概念 | 谁偏心 | 典型表现 |
|---|---|---|
| 长度偏差 | 评分方偏长 | 啰嗦的答案胜率高 |
| 位置偏差(position bias) | 评分方偏前 | 排在 A 位的答案更容易赢 |
| 自我偏好(self-preference) | 评委偏自己 | 给自己写的答案打分更高 |
| 冗长(verbosity) | 模型自身习惯 | 重复、堆砌、加废话 |
注意最后一行:冗长是"输出特征",长度偏差是"评分误差"。前者是症状,后者是病因之一。两者常同时出现,但修法完全不同。
对从业者的意义
做评测时,长度是最该控制的干扰变量:配对比较尽量让两边长度接近;打分时把长度作为回归项扣除,或做长度归一化;人工评审前给出明确评分表,只问"事实对不对、有没有答到点"。做偏好训练时,看一眼正例是否普遍比负例长,是发现该偏差最快的信号。公开榜单的具体口径请以官方页面为准。
对普通人的意义
把"长"和"好"分开。一个回答写了八百字,可能只是没想清楚;先看它有没有在前两句直接回答你的问题。反过来,你可以主动约束:"50 字以内回答""只给结论"。多数模型都能照做——这恰恰说明,它们有能力简短,只是默认不简短。
