跳到主内容
快讯直播
AI智模界
论文

OpenAI 与 Anthropic 公布联合安全评估发现

OpenAI 与 Anthropic 通过 OpenAI 官网发布文章,分享了两家机构开展的一次联合安全评估的发现。这是两家主要前沿模型开发者在模型安全议题上的一次公开协作,相关内容已刊载于 OpenAI 官网的专门页面。

对于 AI 从业者而言,这一动作值得关注之处在于评估主体与评估方式的变化。前沿模型的安全评估长期以来以各家实验室内部的测试、风险评审与自建基准为主。这类自评虽然迭代快、覆盖深,但外部难以验证其结论,不同公司之间的评估口径、风险分类与阈值设定也往往不一致,横向比较困难。当评估由两家相互独立、且在能力竞赛中处于直接竞争关系的机构联合开展时,评估视角的独立性、结论的可比性以及过程的可复核性,都会比单一机构自评更进一步。

从行业层面看,安全评估正在尝试从“各说各话”走向“共同语言”。如果跨实验室的联合评估能够沉淀出可复用的评估项目、风险分类与披露格式,模型能力的对外宣称与安全承诺就有可能建立在更一致的检验基础上,监管方、企业客户与研究者也能获得更可用的参考信息。反过来,联合评估也面临现实约束:评估项目如何选择、结果如何披露、发现严重风险时的处置流程如何协调,都需要两方在竞争关系下达成共识。

目前公开的信息是两家机构就这次联合安全评估所分享的发现本身。评估覆盖的范围、采用的方法与具体结论,需以官方原文为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。