一句话定义:统计显著性(statistical significance)回答的是——两个模型在评测集上差的那 0.3 分,究竟是"真本事有差距",还是"这次抽样恰好运气好"。
为什么会有"假差距"
评测集是样本(sample),模型真实的泛化能力是总体(population)。我们永远只能抽一份卷子来考,所以任何一次跑分都自带抖动。就像让两个学生各做一套 100 道题的卷子,A 考 82 分、B 考 81 分,你很难断言 A 更强——换一套题,结果可能就翻过来了。
样本量(sample size)决定了抖动幅度。评测集只有两三百题时,随机换一批题,总分上下浮动一两分很常见;到了几千题甚至上万题,抖动才会明显收窄。描述这种抖动的区间就是置信区间(confidence interval):比如报告"A 模型 82.1 分,95% 置信区间 [81.0, 83.2]",意思是这类评测反复做,约 95% 的结果会落在这个范围内。
怎么读一个分数
关键原则:看区间,不只看点估计。
| 情形 | 结论 |
|---|---|
| A 82.1,B 81.8,两者区间大幅重叠 | 0.3 分不具备统计显著性,"领先"不成立 |
| A 82.1,B 81.8,区间几乎不重叠 | 差距虽小但稳定,可以说 A 更优 |
| A 82.1,B 79.0,区间完全不重叠 | 差距既显著,也够大,实际意义明确 |
第二行和第三行的区别,就是统计显著性和实际显著性(practical significance)的区别。前者说"这个差距大概率不是噪声",后者说"这个差距大到值得你在产品里做决策"。统计上显著的 0.3 分,对绝大多数业务可能毫无影响;而统计上不显著的 5 分,往往只是样本太少、抖得太厉害,不是真的没差别。
常用名词速览
- p 值(p-value):假设两个模型其实一样强,观测到当前差距甚至更大差距的概率。p 值越小,越不像偶然。
- 显著性水平(α):通常取 0.05,意即"容许 5% 的概率把噪声误判成真差距"。
- 标准误(standard error):分数抖动幅度的度量,与样本量的平方根成反比——想把抖动减半,题目数量大约要翻两番。
对从业者的实际意义
1. 要置信区间,不要单点数字。 用 bootstrap 重采样算一遍区间,成本极低。
2. 优先用配对检验(paired test)。同一批题让两个模型都做,比较"它对你错"和"你对它错"的题数,比直接比总分灵敏得多。
3. 重复评测。换随机种子、换同分布的另一份测试集,看结论是否稳定复现。
4. 拆到子集看。总分持平,可能在某一类任务上差距明显;总分领先,也可能只是某一类题占了大权重。
对普通职场人:看到排行榜上"以 0.3 分优势登顶"这种说法,先问一句"置信区间是多少、评测集多大"。具体评测口径以官方页面为准。小数点后一位的胜负,很多时候只是一次抛硬币的余音。
