一句话定义:均值回归(Regression to the Mean)指的是,当一次结果里混着运气成分时,极端好或极端差的表现,下一次大概率会回到接近平均的水平——不是因为发生了什么新事情,而只是运气这次没站在同一边。这个概念最早来自高尔顿(Francis Galton)对身高的观察。
打个比方:一个人平时考 80 分,某次超常发挥考了 98 分。老师一表扬,下次他只考了 85 分。看起来像“表扬让人骄傲了”,其实 98 分本身就掺了运气,下一次运气回到普通水平,成绩自然落回真实能力附近。
关键在于“极端值被选中”:我们往往只在某件事表现特别突出时才注意到它,于是我们看到的样本,本身已经被筛过一遍。
AI 工作里这个陷阱随处可见。
一个提示词(prompt)第一次跑出惊艳答案,截图发群;第二次、第三次就变平庸了。很容易解释成“模型不稳定”“上下文被污染”,但更朴素的原因是:大语言模型(LLM)每次生成都带采样随机性,第一次那个结果本来就落在分布的右尾。同理,某次内部评测分数突然拉高,后面几轮回落,如果样本量小,未必是版本退步。
还有个变体:人们习惯在“表现最差”的时刻动手调整,于是下一刻怎么走都像被自己修好了。比如线上指标跌到谷底才决定加一条规则,加了之后恢复了,你会觉得这条规则很有效;其实什么都不做,跌到谷底之后本来也有回弹倾向。
怎么区分“回归”和“真的变了”?核心是看重复、看基线。
| 你观察到的 | 更可能是均值回归 | 更可能是真实变化 |
|---|---|---|
| 一次超常发挥后回落 | 只跑了一次,无对照 | 多次运行后整体水平变了 |
| 指标见底后回升 | 恰好从最低点开始干预 | 多轮对照都稳定改善 |
| 新版本首发惊艳或翻车 | 单个用例,噪声占比大 | 同条件下多轮多任务复现 |
实操建议很朴素:把单次结果当成噪声上限很高的信号。评估一个 prompt 或一个版本,就多次运行、换几个相近输入、和旧版本同条件对照,看均值和波动。评测集尽量大一些,因为小样本里极端值占比天然更高。同时保留“什么都不改”的对照组——没有对照,你分不清是改好了,还是本来就该回弹。
对普通职场人也一样:同事一次惊艳的演示、自己一次超常的业绩、团队一次爆款,都别急着找原因归因。先问一句:这里面有多少是运气?把时间拉长,看平均水平,判断会更稳。
(涉及具体评测口径、模型版本与指标定义,以官方页面为准。)
