AI Safety(人工智能安全,常指模型安全与对齐)管的是模型本身别学坏、犯浑、失控;AI Security(人工智能系统安全)管的是模型和它周边的系统别被外人攻破、偷走、下毒。一句话记忆:前者防“模型被用坏”,后者防“模型被攻破”。
打个比方,把 AI 系统当成刚招进来的银行柜员。Safety 关心的是“这位柜员靠不靠谱”:会不会被客户几句话忽悠着违规转账,会不会不懂装懂给出错误理财建议,遇到没见过的业务会不会自作主张。对应的技术手段有 alignment(对齐)、评测、red teaming(红队测试)、可解释性、内容过滤和拒答策略。Security 关心的是“银行这栋楼结不结实”:门锁、监控、金库、员工账号、快递里有没有炸弹。对应的手段有权限与密钥管理、加密、审计日志、输入过滤、供应链安全。柜员再守规矩,金库门开着也白搭;金库再结实,柜员自己乱来照样出事。
两者会在某些地方重叠,比如 jailbreak(越狱)和 adversarial examples(对抗样本),它们既是模型行为问题,也是攻击面问题。区分时看“谁在防、防什么结果”:对齐团队关心模型输出是否符合人类意图,安全团队关心系统是否被未授权访问或篡改。
| 维度 | AI Safety | AI Security |
|---|---|---|
| 一句话 | 防模型被用坏 | 防模型被攻破 |
| 核心问题 | 模型行为是否可控、可靠、符合意图 | 系统与数据是否被未授权访问、篡改、窃取 |
| 典型风险 | 有害输出、幻觉误导、滥用(如批量生成钓鱼邮件) | prompt injection(提示注入)、data poisoning(数据投毒)、model extraction(模型窃取)、API 滥用 |
| 常用手段 | 对齐训练、评测、红队、可解释性、内容策略 | 权限控制、加密、审计日志、输入过滤、供应链安全 |
| 主要团队 | 研究、对齐、风控、政策 | 安全工程、红队、SOC、合规 |
| 类比 | 柜员是否守规矩 | 银行门锁与监控 |
对从业者来说,“我们要保证 AI 安全”这句话太模糊,最好拆成两份清单:Safety 清单管模型输出、评测和上线后的滥用监控;Security 清单管 API 鉴权、提示注入防护、训练数据来源和日志。两套人、两套指标、两套应急预案。对普通人来说,Safety 影响你会不会被 AI 的胡说坑到;Security 影响你发给 AI 的聊天记录、上传的文件会不会泄露,以及别人能否通过一个恶意网页让 AI 替你干坏事。
这不是二选一,而是两道门。具体产品和合规要求,以官方页面为准。
