算法公平性指标(algorithmic fairness metrics)是一组用数字衡量模型在不同群体间是否偏袒的指标,最常见做法是比较各群体的通过率、误差率等差异。
打个比方:小区门禁的人脸识别。如果系统对常住居民放行率 95%,对租客只有 70%,租客就会觉得“门对我更窄”。算法公平性指标就是把这种“门宽差异”算出来。只不过门禁的“通过率”,在信贷、招聘、内容推荐里可能叫审批率、面试率、曝光率。
具体怎么算?先按敏感属性切片,比如性别、年龄、地域、设备类型。然后看两类数字:
- 通过率差异:群体 A 通过率 60%,群体 B 40%,差距 20 个百分点。这对应人口统计学均等(demographic parity):要求各群体通过率接近。它直观,但没考虑“谁本来合格”。如果两个群体资质分布不同,强行拉平通过率可能对合格者不公平。
- 误差率差异:模型判错的比例。比如合格者被拒的假阴性率(false negative rate, FNR),群体 A 是 10%,群体 B 是 30%,说明模型更容易漏掉 B 的合格者。不合格者被放过的假阳性率(false positive rate, FPR)差异,则说明模型对谁更宽松。
由此衍生出不同口径:
- 机会均等(equal opportunity):在真正合格的人里,各群体通过率(真正率,true positive rate, TPR)接近。
- 均等概率(equalized odds):TPR 和 FPR 都接近,更严格。
- 预测率均等(predictive rate parity):在被模型判为通过的人里,实际合格的比例各群体接近。
| 指标 | 在比较什么 | 直觉 |
|---|---|---|
| 人口统计学均等 | 各群体通过率 | 门开得一样大 |
| 机会均等 | 合格者的通过率(TPR) | 合格的人不该因群体被漏 |
| 均等概率 | TPR 与 FPR | 对合格和不合格都不偏心 |
| 预测率均等 | 通过者中的实际合格比例 | 通过名单别掺水 |
它们和相邻概念不同:准确率(accuracy)看整体对多少,公平性指标看群体间差多少;可解释性(explainability)回答“为什么这样判”,公平性指标回答“对不同群体判得是否均衡”;去偏(debiasing)是改模型的手段,公平性指标是量结果的尺子。
对从业者,实用建议是:上线前按群体切片,报告通过率差、FNR 差、FPR 差,别只报总体准确率。因为总体 90% 可能掩盖某个小群体 50% 的误拒率。还要注意这些指标可能互相冲突,不能全都要,得根据业务选口径。对普通人,看到 AI 面试、信贷审批、内容推荐时,可以多问一句:不同群体的通过率和误拒率差多少?具体合规阈值和披露要求,以所在机构或监管官方页面为准。
