一句话定义
差分隐私(Differential Privacy,简称 DP)是一套数学保证:在数据集上做统计或训练模型时,无论某个人的数据在不在这个数据集里,最终输出的结果分布几乎不变——于是别人无法从结果反推出「这个人是否参与过」。
它到底保护什么
先定义「相邻数据集」:两份数据只差一条记录。差分隐私要求算法 M 对任意相邻数据集 D 与 D′、任意输出集合 S,满足 P[M(D)∈S] ≤ e 的 ε 次方 × P[M(D′)∈S]。这里的 ε(epsilon)叫隐私预算:ε 越小,两种情况的输出分布越接近,隐私越强,但要加的噪声也越大。
打个比方:你想公布公司平均工资,又不想让同事算出你的工资。做法是先给结果加一点随机抖动——真实均值 15000,公布出来可能是 14700 或 15300。抖动足够大时,别人分别按「你在」和「你不在」算一遍,得到的分布几乎重合,你的参与与否被噪声吞掉了。就像把一句话混进满屋子人的嘈杂声里,谁也听不出你说了什么。
训练模型时怎么加噪声
机器学习里最常用的做法是差分隐私随机梯度下降(DP-SGD):每一步先对单个样本的梯度做裁剪(clipping),限制任何一条样本的最大影响,再给汇总梯度加噪声。模型整体照样学得会,但单个样本留下的痕迹被稀释。它防的典型攻击是成员推断攻击(membership inference):攻击者拿一个具体的人去问「他是否在这份训练集里」,差分隐私让这个问题无法被可靠回答。
和相邻概念的区别
| 概念 | 保护对象 | 主要手段 | 局限 |
|---|---|---|---|
| 去标识化 | 字段里的身份信息 | 删字段、泛化 | 交叉比对仍可能重识别 |
| k-匿名 | 记录之间不可区分 | 泛化、抑制 | 面对背景知识攻击会失效 |
| 加密、安全多方计算 | 传输与计算过程 | 密码学 | 结果本身仍可能泄露个体信息 |
| 差分隐私 | 外部从结果中的推断能力 | 加噪声 | 有精度损失,需管理隐私预算 |
关键差异是:前几类改的是「数据本身」,差分隐私约束的是「外部能从结果里学到什么」,而且给出的是可证明的保证。它也不排斥其他技术——联邦学习(federated learning,数据不出端)加上差分隐私(上传的更新加噪)就是常见组合。
对从业者和普通人的意义
对从业者,引入 DP 意味着接受隐私—可用性权衡(privacy-utility tradeoff):ε 调小,噪声变大,模型精度或统计可用性下降;调大,隐私保证变弱。还有一个容易被忽略的性质是可组合性(composition)——同一个人被查询多次,隐私会逐步消耗,所以要把 ε 当预算记账,而不是每次查询都当独立的。
对普通人,它让「用我的数据换更好的产品」这件事少了一些二选一的意味。人口统计发布、浏览器和操作系统的使用统计等场景已经采用这类思路,但具体实现、参数与适用范围以官方文档为准。
