一句话定义:效应量(Effect Size)是衡量“差异到底有多大、关系到底有多强”的指标。它回答“提升多少”,而不是“有没有提升”。
为什么 p 值不够:p 值(p-value)回答的是:假设本来没效果,观察到当前数据这么极端的概率有多小。它受样本量影响极大。样本一大,哪怕推荐模型点击率只从 10.00% 到 10.05%,也可能算出很小的 p 值,显示“统计显著”。但 0.05 个百分点值不值得上线?要看服务器成本、维护复杂度、用户体验风险。效应量就是量这个“大小”:可以是绝对差、相对提升、Cohen's d、风险比、R² 等。
打个比方:新药试验的 p 值像“疗效不是运气的证据”;效应量像“病人到底多睡了几分钟、血压降了几毫米汞柱”。如果证据很硬,但只能多睡一分钟,你未必换药。AI 项目里也一样:A/B 测试(A/B testing)证明新排序策略显著,但人均停留只多 0.2 秒,可能不值得。
和相邻概念的区别:
| 概念 | 回答的问题 | 常见误用 |
|---|---|---|
| p 值 | 证据是否足够强? | 把“显著”当“重要” |
| 效应量 | 差异有多大? | 只看相对值,不看绝对值 |
| 置信区间(confidence interval) | 真实效应可能在什么范围? | 只看点估计 |
三者要一起看。统计显著不等于业务显著;业务显著也不等于统计显著。样本小的时候,效应量看着大,也可能是噪声。更稳妥的做法是提前定一个“最小可上线效应”(minimum effect of interest),比如转化率至少提升 0.5 个百分点才值得投入。
对从业者的实际意义:做离线评测、A/B 测试、模型对比时,别只报 p 值。至少同时给出效应量、置信区间和成本。对普通人,看到“显著提升”先问三句:提升多少?绝对值还是相对值?置信区间跨没跨过 0?如果效应小到覆盖不了上线成本,它更像噪声;如果大到能改变决策,才值得上线。具体统计工具和口径,以官方文档为准。
