一句话定义
涉密模型评测(Classified Model Evaluation)指在物理与网络隔离的保密环境中,对可能接触机密数据、或将被部署到敏感系统里的 AI 模型,做一整套能力、安全与合规测试;而且测试用的题目、过程记录和最终结论,本身也按涉密信息管理。以美国国家安全局(NSA)为代表的一些政府机构,近年在这类能力上投入了大量资源,具体规模与项目范围以官方公开信息为准。
为什么不能"在公开榜单上考"
打个比方:普通评测像公开考场,考题、答案、分数都能贴出来;涉密评测像把考生请进一间没有窗户的屋子——考卷本身就是机密,考官要过保密审查,考完连草稿纸都得按密件归档。
原因很直白:要测的东西本身就是保密的。比如让模型读一份未公开的漏洞分析、一段内部通信记录,然后看它会不会在追问下复述出来、会不会被诱导把上下文里的敏感内容"顺"给用户。这类问题只有用真数据才测得出来,而真数据不能出屋。
评什么
- 能力:在涉密语料上是否真能干摘要、翻译、检索、写代码,而不是只会背公开语料。
- 边界:拒答策略是否稳定,会不会因为换种问法就松口。
- 安全:越狱(jailbreak)、提示注入(prompt injection)、数据外泄路径、日志里是否残留敏感内容。
- 供应链:权重从哪来、推理服务跑在哪、日志落盘在哪、更新通道是否可控。
- 人机流程:人在回路(human-in-the-loop)怎么设计,出了问题谁负责、怎么留痕。
怎么做到"又测又保密"
常见做法是空气隔离(air-gapped)环境、专用硬件、无外网;按需知原则(need-to-know)分级授权,红队(red teaming)成员签保密协议并限定范围;测试集本身分级,对外只给脱敏结论。最终交付的往往不是分数,而是一句"可以放行 / 限定场景使用 / 不予放行"。
和相邻概念的区别
| 维度 | 厂商自评 | 第三方独立审计 | 涉密模型评测 |
|---|---|---|---|
| 谁在做 | 模型厂商自己 | 外部测评机构 | 政府或授权机构、涉密团队 |
| 用什么测 | 公开或内部基准 | 合同约定的测试集 | 真实涉密语料与业务数据 |
| 结果公开度 | 常公开 | 有限公开 | 基本不公开 |
| 目的 | 证明能力、改进产品 | 合规与信任背书 | 决定能否在敏感环境部署 |
对从业者的意义
做政务、国防、关键基础设施方向的团队,交付物不只是模型本身,还包括"可评测性":离线部署包、可复现的推理环境、清晰的权限分级和审计日志。公开榜单上的高分不是通行证——涉密评测关心的是,在你部署的那个环境、用那批数据时,模型到底靠不靠得住。
