跳到主内容
快讯直播
AI智模界
AI 词典

数据投毒:往模型的口粮里掺沙子

数据投毒(Data Poisoning)指的是:在模型训练所用的数据里,故意掺入少量精心构造的恶意样本,让训练出来的模型学会错误、危险或对攻击者有利的行为。它动的是"教学内容",不是某一次回答。

为什么一点点就够

模型不是把样本背下来,而是从海量例子里统计规律。如果某个触发词反复和某个错误答案一起出现,模型就可能把这条"捷径"当成规律记住。好比给一个班的学生都发同一本印错答案的习题册,考场上他们会整齐地写同一个错答案——错的不是某个人,是所有人都学歪了。攻击者不需要控制大部分数据,有时极小的污染比例就足以埋下后门(backdoor):平时输出正常,一旦输入里出现约定的触发词(trigger),模型立刻"变脸"。

常见玩法有三类:后门投毒,埋触发词;目标投毒,让模型对某类问题持续偏向某个立场或商品;可用性投毒,灌大量噪声样本,让模型整体变笨。值得注意的是,投毒的入口不只是预训练语料,微调数据、人类反馈排序、检索知识库,都可能成为下手的对象。

和几个近邻的区别

概念动手阶段改的是什么是否故意
数据投毒训练/微调模型参数
对抗样本推理输入
数据污染数据准备评测结果多为无意
提示注入推理上下文指令

数据污染(data contamination)常指测试题混进了训练集,导致评分虚高,一般不是有人故意做局;对抗样本(adversarial example)和提示注入(prompt injection)都发生在使用阶段,模型本身没被改。投毒则是从源头把模型教坏。

对从业者和普通人的意义

对做模型的人,数据管道的权限就是安全边界:来源要可追溯,第三方数据集、众包标注、爬取语料都得过一遍异常检测和人工抽检;上线前用触发词做红队测试,看有没有"闻到某个词就反常"的毛病。具体的数据治理流程以各厂商官方页面为准。

对普通人,这里有两层提醒:一是在网上公开发布的内容可能被爬去当训练语料,你我都在数据链路里;二是别把模型输出当成不容置疑的答案——它对某个古怪词汇格外敏感,或对某类问题态度异常统一,都可能不是"个性",而是被喂出来的。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。