一句话:PII 脱敏就是在数据被写进日志、发进 prompt、传给第三方之前,把能直接指向某个具体人的字段删掉或遮掉。
PII 是 Personally Identifiable Information(个人身份信息)的缩写,姓名、手机号、身份证号、邮箱、住址、银行卡号、人脸都算。脱敏(Redaction)做的动作很朴素:把原文里的「张三,138xxxxxxxx,住北京市朝阳区……」变成「[姓名],[手机号],住[住址]……」。其余内容照旧可用。
打个比方:你要把一份合同扫描件发给外部顾问,先拿黑色马克笔把甲方的名字和账号涂掉再复印。顾问仍然能看懂条款、给出建议,但他不知道是谁。脱敏就是这个「涂黑」的步骤,只不过在数据管道里由代码批量完成。
流程一般是两步。先识别:正则匹配手机号、身份证这类有固定格式的,词典匹配姓名和公司名,再靠 NER(Named Entity Recognition,命名实体识别)模型去捞自由文本里的人名地名;纯靠正则一定会漏,因为「住在苹果园」「王工」这种写法没有格式可循。再处理:直接删除、部分掩码(139****1234)、替换成占位符,或者换成编号(假名化)。注意「不可逆」这件事——删掉的字段无法还原,这正是它比加密更让人放心的原因。
它常被和几个邻居搞混:
| 手段 | 做什么 | 可逆性 | 主要防什么 |
|---|---|---|---|
| 脱敏 Redaction | 删掉或遮住敏感字段 | 通常不可逆 | 字段级直接泄露 |
| 假名化 Pseudonymization | 换成编号,映射表另存 | 有映射表即可逆 | 一线人员看到真名 |
| 差分隐私 AI 词典:Differential Privacy">Differential Privacy | 给统计结果加噪声 | 不适用于单条 | 从聚合结果反推个体 |
| 加密 Encryption | 密文保存 | 有密钥可逆 | 存储被拖库 |
重点说说差分隐私:它不擦任何字段,而是让「某个人在不在这个数据集里」对最终统计结果几乎没影响。一个管的是字段,一个管的是个体对结果的贡献,完全不是一回事。
对从业者的实际意义:日志、prompt、评测集、标注平台、第三方模型 API,都是泄露面。三条经验——在数据进入日志或模型调用之前脱敏,而不是事后补救;规则加模型双重兜底,再抽检;脱敏后仍可能被组合信息重新识别(「公司里唯一一位负责海外业务的女性」),高风险场景别只信自动流程。合规口径各地不同,具体以官方页面和法务意见为准。
对普通人:发简历、贴病历、把群聊截图丢给聊天机器人之前,先想一秒「这上面有谁的名字和电话」。少给一点,少一分麻烦。
