跳到主内容
快讯直播
AI智模界
AI 词典

模型逆向攻击:从输出反推出训练数据里的脸

模型逆向攻击(model inversion attack)是指:攻击者只拿到模型的输出,就能反推出训练数据里某个类别的敏感样本大致长什么样。最典型的场景,是把某张人脸从一个人脸识别模型里「画」出来。

打个比方:你和一个人之间隔着一道磨砂门,你只能一张张递画给他看,他每次只回一句「这张有几分像」。你看不见他,也问不出他叫什么,但可以照着分数反复改画,改到分数最高为止。最后手里那张画,往往已经能看出他的大概长相。

模型逆向走的就是这条路。人脸识别模型对每个输入会给一个置信度(confidence)分数,比如「这张脸是张三的概率 0.87」。攻击者已知训练集里有「张三」这个标签,于是拿一张随机噪声图反复喂给模型,把分数当路标做梯度上升,一点点调像素,直到模型对「张三」这一类的置信度稳定变高。合成出来的图未必和原图逐像素一致,但脸型、眼镜、发型这些特征常常保留下来,足以认出人。在联邦学习这类需要上传梯度的场景,攻击者甚至能直接从梯度反推参与训练的图片。共同点是:模型没有吐出数据本身,但吐出了关于数据的足够多信息。

这里最容易和AI 词典:成员推理攻击">成员推理攻击(membership inference attack)混为一谈,一句话分清:成员推理回答「这条数据在不在这批训练数据里」,输出是是或否;模型逆向回答「这条数据长什么样」,输出是一张合成出来的图。

成员推理攻击模型逆向攻击
想回答的问题你在不在训练集里你长什么样
输出是 / 否重建出的图像、特征或文本
典型危害泄露「某人参与过某敏感数据集」泄露人脸、病历等内容本身

两者经常配合使用:先用成员推理确认目标确实在训练集里,再用逆向攻击把内容还原出来。

对从业者的意义

接口层面,非必要不返回完整置信度向量,只给最终标签或 top-k,能砍掉大量可利用的信息量。训练层面,可以考虑差分隐私(differential privacy)、梯度裁剪等做法。数据层面,敏感字段能不入模就不入模,必须入模先做不可逆脱敏。还有一点容易被忽略:用户的删除请求不只是删数据库——参数里可能仍留有痕迹,必要时得重训,或用机器遗忘(machine unlearning)处理。

对普通人的意义

你上传过的人脸、体检报告、聊天记录,一旦参与过模型训练,「删掉文件就没事了」并不成立,模型本身就可能携带这些信息。具体平台保留多久、如何删除、是否重新训练,以官方隐私政策页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。