统计功效(Statistical Power)指:当某个效果真实存在时,你的实验或评测能把它认出来的概率。常用目标是至少 80%。它回答的不是“结果显著吗”,而是“如果真有 2% 提升,我这点样本量抓得住吗”。
把评测想成用体温计判断是否发烧。真实升温 0.2°C,但体温计有误差。量一次可能看不出;量很多次取平均,才容易分辨。统计功效就是“真实有升温时,体温计报警的概率”。它由四件事决定:真实差异大小(效应量)、样本量、噪声/方差、判断阈值 α。差异越小、噪声越大、样本越少,功效越低。
放到 AI 评测里:假设基线准确率 80%,新模型 82%,差 2 个百分点。若用独立样本、α=0.05、功效 80%,粗略每组需要约 6000 个题/样本,两组共约 1.2 万。若相对提升 2%(80%→81.6%),每组可能要近 1 万。实际用同一套题对比两个模型,可用配对检验,所需样本可能少一些,但量级通常仍是几千到上万。若只有 500 道题看到 +2%,很可能只是噪声。LLM 还有生成随机性:温度、采样、提示词、运行环境都会带来波动。只跑一次、只看总分,等于用一次体温测量做决策。应该多跑几个种子/多组样本,报告均值和波动范围。
| 概念 | 回答的问题 | 关键点 |
|---|---|---|
| 显著性水平 α | 没效果时误报概率多大 | 常设 0.05,控制假阳性 |
| p 值 | 当前数据多不像“没效果” | 小不等于效果大 |
| 统计功效 | 真有效时能检出概率多大 | 常要求 ≥0.8,控制假阴性 |
| 效应量 | 提升到底多大 | 2% 属小效应,需要大样本 |
| 样本量 | 要多少题/人/次 | 由前四者共同决定 |
对从业者,评测前先做功效分析或样本量估算;固定测试集和随机种子;不要反复看结果再决定停不停(p-hacking)。对普通人,看到“小样本+小幅提升”的结论,先问样本多少、波动多大、能否复现。功效不足时,“不显著”不代表没提升;功效够了,2% 也可能显著,但仍要问业务上值不值得。具体公式和工具以权威统计教材或所用平台文档为准。
