一句话定义
双重差分(Difference-in-Differences,DID)是一种因果推断方法:用"干预前后的变化"减去"同期没受干预的对照组的变化",剩下的那块,才是干预的净效果。
只看前后对比,会骗自己
团队上了 AI 编程助手,一个月后交付量涨了 15%。这 15% 是 AI 的功劳吗?也可能是业务旺季、也可能本来就在爬坡。只看"前后对比",所有同期发生的事都会被算到 AI 头上。
DID 的思路是:找一群没上 AI 的人当对照,把他们的同期变化减掉。
打个比方:A 班换了新教辅,B 班没换。期末 A 班平均分从 70 涨到 78,B 班从 72 涨到 75。直接说教辅带来 8 分是高估了——B 班涨的 3 分说明卷子整体偏简单,净效果大约是 8 − 3 = 5 分。
换成 AI 场景:处理组交付量 16 → 20(+4),对照组同期 15 → 14(−1,赶上季度末低谷)。DID 估计的净效应是 4 − (−1) = 5。注意对照组在往下走,只做前后对比反而会低估。
核心前提:平行趋势
DID 成立的关键假设叫平行趋势(parallel trends):如果没有上 AI,两组的指标走势应该大致同步。这个假设没法直接证明,只能用干预前的历史数据做间接检验——把前几个月两组的曲线画出来,看是否基本平行。如果处理组本来就在猛涨(比如公司把最强团队挑去试点),结果就不可信。
和相邻概念的区别
| 方法 | 需要随机分组 | 能否剥离时间趋势 | 典型场景 |
|---|---|---|---|
| 前后对比 | 不需要 | 否 | 快速看个感觉 |
| A/B 测试 | 需要 | 是 | 可以随机分配时 |
| 双重差分 | 不需要 | 是 | 整团队、整地区统一推行 |
A/B 测试就是随机对照试验(Randomized Controlled Trial),靠随机化把干扰因素摊平;DID 用在没法随机分组的场合,比如某地先试点一项政策、某个部门先全员推广工具。因为分组不随机,它更脆弱,通常还要做安慰剂检验、更换对照组、画事件研究图之类的稳健性检查。
对从业者的实际意义
1. 看到"上 AI 后提效 30%",先问一句:对照组是谁?没有对照组,这个数字只能当故事听。
2. 推行 AI 工具时,不妨有意留一批人晚一两周上线。成本很低,却能换来一次可信的评估。
3. 自己汇报成果时,主动区分"前后对比"和"双重差分",可信度完全不是一个量级。
公式很简单:(处理组后 − 处理组前)−(对照组后 − 对照组前)。难的是找到趋势可比的对照组。具体工具与实现细节,以官方文档为准。
