一句话定义:Internal Eval Air-gap(内部评测气隙隔离)是指在做模型和智能体的内部评测时,把评测环境与外网、公司内网、生产系统在物理或网络层面彻底断开,只给被测智能体(agent)一个"看起来像真的、其实是布景"的世界。
为什么需要它
过去的模型评测基本是"答题":给一批题,看正确率。但现在的智能体能写代码、开浏览器、调用接口、读写文件。一旦评测环境连着真互联网,事情就失控了:
- 智能体可能真的下单、发邮件、给真实用户发消息;
- 可能把评测题目或内部数据带出去;
- 也可能从外面抓回内容,污染评测,让结果不可信;
- 评测里试出的"绕开限制"的手法,还可能被带到生产环境复用。
"气隙"(air-gap)这个词来自传统安全:真正敏感的机器不插网线,靠物理断开而不是防火墙来隔离。用在评测上,就是把隔离从"策略层"提到"基础设施层"。
一个比方
飞行员在模拟舱里练紧急迫降,可以随便摔。但模拟舱的门是焊死的——学员操作再猛,飞机也不会真的冲出跑道。气隙评测就是这个焊死的门。舱里往往还搭了一座"假城市":假的搜索引擎、假的电商、假的邮件服务器,答得有模有样,数据其实全在本地。
通用实现方式
- 独立网络命名空间或 VLAN,默认路由干脆不存在,域名解析走内部假 DNS;
- 出网只允许白名单代理,且全程记录;
- 用 mock 服务或本地镜像顶替常见外部接口;
- 虚拟机快照加一键回滚,跑完就销毁;
- 评测框架默认把被测智能体当作"不可信",而不是"应该会听话"。
和相邻概念的区别
| 概念 | 隔离粒度 | 典型目的 |
|---|---|---|
| 沙箱 AI 词典:Sandbox">Sandbox | 进程/代码级,限制系统调用与权限 | 防止一段代码搞坏宿主机 |
| 离线评测 | 数据集级,不联网跑分 | 可复现、可比较 |
| 气隙隔离 | 网络与环境级,整台机器或整个集群断开 | 防止有自主行动能力的智能体碰到真实世界 |
三者常常叠加:气隙是外壳,沙箱是内衬。
对从业者的意义
设计评测要有"默认恶意"的心态:把被测智能体当成可能主动外联、主动逃跑的对象。评测报告里最好写明环境隔离到什么程度——能上网的智能体和断网的智能体,测出的能力与风险完全不是一回事。Anthropic 等前沿实验室在公开的负责任扩展(Responsible Scaling)相关材料中谈过类似做法,具体细节以官方页面为准。
对普通人的意义
"评测智能体会不会干坏事"这件事本身有风险。气隙的存在意味着:公司在测模型时,模型并没有真的在外面乱跑。看到"我们在隔离环境中完成安全评测"这类表述,你大概能知道,它背后是一堆实打实的工程约束,而不只是一句表态。
