跳到主内容
快讯直播
AI智模界
AI 词典

对抗训练:把攻击样本掺进训练里

一句话定义:对抗训练(Adversarial Training)是在训练时主动生成对抗样本(adversarial examples),把它们和正常样本混在一起,让模型在“被故意捣乱”时也能答对。

它怎么起作用:正常训练只要求模型在训练集上做对,模型可能走捷径:看到几个特定像素或关键词就下判断。攻击者只要加一点人眼难察觉的扰动(perturbation),或替换几个词,就能让模型翻车。对抗训练像请了个专打你破绽的陪练:每轮先算出当前模型最怕的微小改动,再逼它在这些改动下仍输出正确结果。本质上,这是把决策边界从样本附近推开、让边界更平滑,迫使模型学更稳的特征。

为什么有效却代价高:生成对抗样本要额外计算,FGSM、PGD 这类方法需要额外前向甚至多步反向传播,训练成本可能成倍上升。它优化的是“最坏情况下的损失”,比普通训练更难更不稳,超参也更敏感。更常被吐槽的是掉点:模型在正常测试集上的准确率(clean accuracy)往往下降,这就是鲁棒性与精度的权衡(robustness-accuracy trade-off)。而对抗样本上的准确率(adversarial accuracy)提升,也常只对训练时那类攻击更有效,遇到新攻击仍可能被绕过。

和相邻概念的区别:

概念做什么主要目标
普通训练只用正常样本正常数据上准
数据增强随机旋转、裁剪、加噪提升一般泛化
对抗攻击故意加扰动骗模型让模型出错
对抗训练把攻击样本加进训练抗扰动

实际意义:人脸核身、自动驾驶感知、内容风控、恶意流量识别等场景,值得把对抗训练作为选项,但它不是银弹,通常要配合输入检测、模型集成、随机化等手段。评估不能只看干净准确率,要做扰动测试和跨攻击测试。对普通职场人,可以把它理解成“培训不能只做原题,还要做陷阱题”;但陷阱题做多了,原题手感可能下降,值不值得,取决于业务更怕哪种错。具体实现和参数以所用框架官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。