据 The Verge 报道,Anthropic 正在把其内部评估(evaluations)环境与互联网断开连接。也就是说,在对其模型进行能力与安全性评测时,相关环境将不再具备联网能力。
对前沿 AI 实验室来说,评估环境是否联网并非一个纯技术细节,它直接关系到评测结论的可信度。
从评测方法的角度看,联网会带来结果污染的风险。如果被测模型能在评测过程中访问网络,它就有可能检索到答案或公开的题目与解法,而不是依靠自身推理完成任务,从而使分数无法反映真实能力边界。
从安全评估的角度看,联网还会放大不确定性。安全评测关注的往往是模型在受控条件下的行为倾向;一旦具备联网与调用外部服务的能力,行为链条被拉长,很难判断某个结果是模型自身的选择,还是外部信息与环境交互的产物。把网络切断,是把变量重新收敛到模型本身。
此外,评估结果通常也是 AI 公司对外说明模型能力的依据,评测环境的可控性越强,结论越经得起外部审视。
目前公开信息中,尚未见到关于这一措施具体实现方式、覆盖范围与生效时间的更多说明。对从业者而言,更值得关注的是其背后的趋势:随着模型能力提升,评测基础设施本身正在成为需要严格管控的对象,而不再只是跑分的脚本与题库。
