跳到主内容
快讯直播
AI智模界
AI 词典

随机对照试验(RCT):别让混杂因素替你下结论

一句话定义:随机对照试验(Randomized Controlled Trial,RCT)是把研究对象随机分进「接受干预」和「不接受干预」(或接受另一种干预)两组,再比较结果差异的实验设计。

为什么随机这一步不能省

假设要验证一款新药有没有效。如果让病情轻的人吃药、病情重的人不吃,最后吃药组恢复得更好,你也说不清是药的功劳,还是他们本来就轻。这个「病情轻重」就是混杂因素(confounder):它同时影响「谁吃到了药」和「结果好坏」,把因果关系搅浑了。

随机分组相当于给每个人抛一次硬币。谁进哪一组,和病情、年龄、收入、作息都无关。样本量足够时,两组在已知因素上大体均衡,在未知因素上也「平均而言」均衡。于是两组之间唯一稳定的系统性差别,就是有没有吃药——结果差异才有资格归因到干预本身。

和相邻方法的区别

方法是否随机分组能否下因果结论常见场景
随机对照试验是可以临床试验、线上 A/B 测试
观察性研究否一般不行用户行为分析
单组前后对比没有对照组很弱功能上线后看指标
准实验不随机或部分随机视情况无法随机化的场景

A/B 测试本质上就是互联网产品里的 RCT:随机切分流量,在同一时间窗口内对比点击、转化、留存。而单组前后对比最大的问题,是时间趋势、季节波动、同时上线的其他改动,都会被记到你这个功能头上。

对 AI 从业者的意义

评估 AI 功能时,最常见的做法是「挑几个 demo 看看」。想验证加了AI 词典:检索增强生成">检索增强生成(RAG)之后回答是否更好,得随机抽样问题、随机分配处理方式,并把温度、上下文长度、系统提示这些变量固定住,否则测出来的是好几样东西混在一起的效果。

模型 A/B 同理:流量随机切分、指标提前定死、样本量算够。如果中途反复偷看数据、一见显著就停,假阳性率会明显抬高——问题不在随机化,而在使用方式。

也要承认局限:伦理、成本、用户不愿意被分到差版本,都可能让随机化做不成。这时只能退到准实验,把局限讲清楚,别把相关说成因果。另外,随机化消除的是偏差,消不掉运气,显著性检验和足够样本量依然必要。具体实验平台的配置方式与统计口径,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。