跳到主内容
快讯直播
AI智模界
AI 词典

统计功效:2% 的提升,多少样本才可信?

统计功效(Statistical Power)指:当某个效果真实存在时,你的实验或评测能把它认出来的概率。常用目标是至少 80%。它回答的不是“结果显著吗”,而是“如果真有 2% 提升,我这点样本量抓得住吗”。

把评测想成用体温计判断是否发烧。真实升温 0.2°C,但体温计有误差。量一次可能看不出;量很多次取平均,才容易分辨。统计功效就是“真实有升温时,体温计报警的概率”。它由四件事决定:真实差异大小(效应量)、样本量、噪声/方差、判断阈值 α。差异越小、噪声越大、样本越少,功效越低。

放到 AI 评测里:假设基线准确率 80%,新模型 82%,差 2 个百分点。若用独立样本、α=0.05、功效 80%,粗略每组需要约 6000 个题/样本,两组共约 1.2 万。若相对提升 2%(80%→81.6%),每组可能要近 1 万。实际用同一套题对比两个模型,可用配对检验,所需样本可能少一些,但量级通常仍是几千到上万。若只有 500 道题看到 +2%,很可能只是噪声。LLM 还有生成随机性:温度、采样、提示词、运行环境都会带来波动。只跑一次、只看总分,等于用一次体温测量做决策。应该多跑几个种子/多组样本,报告均值和波动范围。

概念回答的问题关键点
显著性水平 α没效果时误报概率多大常设 0.05,控制假阳性
p 值当前数据多不像“没效果”小不等于效果大
统计功效真有效时能检出概率多大常要求 ≥0.8,控制假阴性
效应量提升到底多大2% 属小效应,需要大样本
样本量要多少题/人/次由前四者共同决定

对从业者,评测前先做功效分析或样本量估算;固定测试集和随机种子;不要反复看结果再决定停不停(p-hacking)。对普通人,看到“小样本+小幅提升”的结论,先问样本多少、波动多大、能否复现。功效不足时,“不显著”不代表没提升;功效够了,2% 也可能显著,但仍要问业务上值不值得。具体公式和工具以权威统计教材或所用平台文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。