一句话定义:模型窃取(Model Extraction)指攻击者只通过调用目标模型的应用程序接口(API),收集大量“输入—输出”样本,再训练出一个功能相近的替代模型,从而在不接触源代码和权重的情况下复制其能力。
把模型想成一家只卖成品菜、不公开菜谱的餐厅。你每天去点菜,记录每道菜的味道、配料和口感,回家反复试做,最终做出一桌八九不离十的菜。模型窃取的“点菜”就是API查询:给模型一段文字、一张图,拿到它的输出。查询次数足够多、覆盖足够广,替代模型就能学会目标模型的决策边界。更麻烦的是,如果API返回概率分布(logits/softmax),信息量比只返回最终答案大得多,复制会更容易。攻击者不一定要100%一样,只要在目标场景够用,就能省下大量训练成本。
它容易和几个相邻概念混淆:
| 概念 | 攻击者想知道什么 | 典型手段 |
|---|---|---|
| 模型窃取 | 复制模型功能 | 大量API查询+训练替代模型 |
| 模型逆向 | 推断训练数据 | 利用输出反推敏感样本 |
| 成员推断 | 某条数据是否用于训练 | 观察模型对样本的置信度 |
| 知识蒸馏 | 小模型学大模型(常为合法) | 用软标签训练学生模型 |
| 对抗样本 | 让模型当场出错 | 对输入加微小扰动 |
模型窃取和蒸馏技术很像,区别在意图和授权:蒸馏常是模型拥有者主动为之,模型窃取是未授权复制。
对做AI产品的团队,API既是收入来源,也是知识产权泄露面。防御上可以限流、按账号监控异常查询、只返回top-1、加输出噪声、嵌入水印、检测查询分布是否像在“扫边界”。但攻防不对称,完全防住很难,得权衡体验和成本。对普通职场人,这意味着你调用的AI能力可能被竞争对手快速仿制,模型本身的护城河不只是权重,还包括数据、迭代速度、产品和生态。用API前看清服务条款,别把未授权复制当成“技术中立”。具体限制和合规要求以官方页面为准。
