一句话定义:智能体最小权限(Least Privilege for Agents)是指只给 AI 智能体(Agent)完成当前任务所需的最小访问权,并且限时、限范围、可撤销。它不是“相信模型不会乱来”,而是“就算它被提示注入、跑偏或被人利用,也拿不到不该拿的东西”。
展开:普通程序权限常由开发者写死;智能体却要自己决定调哪个工具、读哪个文件、发什么请求。权限一宽,风险就成倍放大。打个比方:请临时工进办公室修灯,你不会把整串钥匙给他,而是只给配电间和门禁,且只在今天有效。对应到智能体:别给一个能读所有仓库、能转账、能删库的万能 API key(应用编程接口密钥);而是给一个只含“读订单表”、有效期很短、只能从特定服务调用的令牌。文件也一样:只挂载任务需要的目录,优先只读;必须写就写到临时沙箱(AI 词典:Sandbox">Sandbox),任务结束销毁。密钥不要写进提示词,也不要放代码库,放密钥管理服务(Secrets Manager),由网关按需注入。
它和相邻概念的区别:模型对齐(Alignment)让模型“想做好事”;最小权限让它“做不了太坏的事”。沙箱隔离运行环境;最小权限还约束身份、数据和动作。它也是零信任(Zero Trust)在智能体上的落地:每次调用都要验证、授权、留痕。
| 维度 | 宽权限 | 最小权限 |
|---|---|---|
| 密钥 | 长期共用、全量权限 | 按任务签发、短时、限定 scope |
| 文件 | 整个磁盘或家目录 | 白名单目录、只读优先、临时可写 |
| 动作 | 可直接生产写、转账 | 高危动作需审批或人工确认 |
| 审计 | 事后难追踪 | 每次调用有身份、日志、可撤销 |
出事时能少赔多少?没有统一数字,取决于合同、法规和实际损失,以官方页面和合同为准。但逻辑确定:权限越窄,攻击面越小,爆炸半径(Blast Radius)越小。被提示注入的智能体如果只有读权限,最坏可能是泄露它能读的那部分数据;如果还有写权限和转账权,最坏可能是篡改和盗刷。前者的恢复、赔偿与合规成本通常低得多。
对从业者:把权限当产品功能设计,默认拒绝,按任务发临时通行证。对普通人:看到“授权 AI 访问邮箱、网盘、支付”时,先问能否只读、只选一个文件夹、只给一次。
