跳到主内容
快讯直播
AI智模界
AI 词典

AI Safety 与 AI Security 的区别

AI Safety(人工智能安全,常指模型安全与对齐)管的是模型本身别学坏、犯浑、失控;AI Security(人工智能系统安全)管的是模型和它周边的系统别被外人攻破、偷走、下毒。一句话记忆:前者防“模型被用坏”,后者防“模型被攻破”。

打个比方,把 AI 系统当成刚招进来的银行柜员。Safety 关心的是“这位柜员靠不靠谱”:会不会被客户几句话忽悠着违规转账,会不会不懂装懂给出错误理财建议,遇到没见过的业务会不会自作主张。对应的技术手段有 alignment(对齐)、评测、red teaming(红队测试)、可解释性、内容过滤和拒答策略。Security 关心的是“银行这栋楼结不结实”:门锁、监控、金库、员工账号、快递里有没有炸弹。对应的手段有权限与密钥管理、加密、审计日志、输入过滤、供应链安全。柜员再守规矩,金库门开着也白搭;金库再结实,柜员自己乱来照样出事。

两者会在某些地方重叠,比如 jailbreak(越狱)和 adversarial examples(对抗样本),它们既是模型行为问题,也是攻击面问题。区分时看“谁在防、防什么结果”:对齐团队关心模型输出是否符合人类意图,安全团队关心系统是否被未授权访问或篡改。

维度AI SafetyAI Security
一句话防模型被用坏防模型被攻破
核心问题模型行为是否可控、可靠、符合意图系统与数据是否被未授权访问、篡改、窃取
典型风险有害输出、幻觉误导、滥用(如批量生成钓鱼邮件)prompt injection(提示注入)、data poisoning(数据投毒)、model extraction(模型窃取)、API 滥用
常用手段对齐训练、评测、红队、可解释性、内容策略权限控制、加密、审计日志、输入过滤、供应链安全
主要团队研究、对齐、风控、政策安全工程、红队、SOC、合规
类比柜员是否守规矩银行门锁与监控

对从业者来说,“我们要保证 AI 安全”这句话太模糊,最好拆成两份清单:Safety 清单管模型输出、评测和上线后的滥用监控;Security 清单管 API 鉴权、提示注入防护、训练数据来源和日志。两套人、两套指标、两套应急预案。对普通人来说,Safety 影响你会不会被 AI 的胡说坑到;Security 影响你发给 AI 的聊天记录、上传的文件会不会泄露,以及别人能否通过一个恶意网页让 AI 替你干坏事。

这不是二选一,而是两道门。具体产品和合规要求,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。