默认失陷假设(Assume Compromise)是一种安全设计前提:不再假设模型、提示词、工具或数据链路是干净的,而是假设攻击者已经控制其中某一环,再倒推系统该怎么限权、检测、隔离和恢复。
传统安全像小区围墙:先筑高墙,门禁刷卡,墙内默认是“自己人”。默认失陷假设则像在每个房间都装摄像头和保险柜:不纠结“坏人有没有进来”,而问“他进来了能开哪几扇门、能拿走多少东西、多久会被发现”。它的关键不是悲观,而是把“已经失陷”当成设计起点。
和相邻概念的区别:
| 维度 | 边界防御 | 零信任 | 默认失陷假设 |
|---|---|---|---|
| 核心问题 | 怎么挡住 | 每次访问都要验证 | 已验证的也可能已被劫持 |
| 信任起点 | 内网可信 | 默认不信任 | 默认已失陷 |
| 主要动作 | 防火墙、隔离区 | 持续验证、最小权限 | 限爆炸半径、可回滚、可观测 |
| 失败姿态 | 被攻破后被动响应 | 减少横向移动 | 假定横向移动已发生 |
边界防御(Perimeter Defense)关心“墙牢不牢”;零信任(Zero Trust)说“永远不信任,持续验证”;默认失陷假设更狠一步:连“验证通过”的会话、模型权重、检索内容都可能被污染,所以重点从“防进入”转向“防扩散、防不可逆损失”。
对从业者,这意味着几件具体事:
- 模型输出默认是不可信输入,不直接当指令或事实执行。
- 密钥、令牌不塞进模型上下文;工具调用走独立鉴权网关。
- 日志、审计、快照默认开启,异常行为能回滚。
- 红队目标从“能不能攻破”改成“攻破后能走多远”。
在智能体(Agent)系统里,落地方式尤其清晰:
1. 工具最小权限:读文件和发邮件分开授权;写操作默认关闭,必要时二次确认或人工审批。
2. 上下文隔离:把网页、邮件、文档标记为不可信数据,禁止它们改写系统提示或工具策略,这是防提示注入(AI 词典:Prompt Injection">Prompt Injection)的基本功。
3. 动作分级:可逆动作自动执行,不可逆动作(转账、删库、对外发消息)强制闸门。
4. 熔断与预算:每个智能体有身份、调用额度、速率上限;行为偏离基线就冻结。
5. 恢复设计:假设凭证会泄露、记忆会被污染,提前设计轮换、回滚和重建。
一个普通职场例子:让 AI 助手读邮箱自动排会。传统思路是“给它权限,让它干”。默认失陷假设下,默认某封邮件可能是攻击者写的,会诱导助手把邀请发给外部人。于是助手只能读不能发;要发,必须列出收件人让人点确认。
它不追求绝对安全,而是追求“失陷了也不至于全盘皆输”。产品具体能力以官方页面为准。
