一句话定义:可审计世界模型(Auditable AI 词典:World Model">World Models)是一类在预测未来的同时,把"我为什么这样预测、为什么这样决策"的推理过程与依据记录下来、可供人独立复查的世界模型(World Model)。
先说什么叫世界模型
世界模型是 AI 内部的一台"脑内模拟器"。给它当前的环境状态和一个动作,它会推演"接下来会发生什么"——机器人伸手会不会碰到杯子、车变道后前车会不会急刹。学棋的人心里默算三步,就是在用自己的世界模型做推演(rollout)。它是很多规划、自动驾驶仿真、强化学习系统的地基。
"可审计"加的是什么
传统做法只看结果:预测得准不准。问题是,一个模型可以预测得很准,却靠的是错误的理由——就像有人蒙对了答案,你没法判断他下次还对不对。可审计要求三件事:
1. 决策留痕:每一步推演基于什么状态、什么假设,要能调出来看,而不是只有一个最终输出。
2. 反事实可复现:能回答"如果当时选另一个动作会怎样",并且重跑一遍能得到同样的过程。
3. 和现实对账:预测和真实观测的偏差,能定位到具体是哪条假设出了问题。
打个比方:普通世界模型像一位凭直觉下判断的老手,问他理由只说"我感觉得到";可审计世界模型像飞机上的黑匣子,不只记录结论,还记录仪表读数、操作序列和时间戳。出了事,能一帧一帧回放。
和相邻概念的区别
| 概念 | 关心什么 | 典型局限 |
|---|---|---|
| 视频预测模型 | 下一帧像素像不像 | 画面逼真但不支撑决策 |
| 可解释性(Explainability) | 给出一个人能听懂的解释 | 解释可能是事后编的 |
| 思维链(Chain-of-Thought) | 用自然语言说出思路 | 叙述流畅但无法独立核验 |
| 可审计世界模型 | 推理与决策过程可被第三方复核 | 需要额外的记录与验证开销 |
关键差别在于"给解释"和"留证据":前者是请你相信这段话,后者是你可以自己动手查。
对从业者与普通人的意义
对做工程的人,可审计最大的价值是分锅。当规划失败时,你能判断是世界模型预测错了,还是决策器在正确预测下选错了——这在只有端到端指标时几乎无法区分。合规要求高的场景(医疗、交通、金融审批),"为什么这么判断"本身就是要交付的东西。
对普通人,感受会更直接:当 AI 参与影响你的事情时,你需要的不是一句"模型认为",而是一本能翻的账。世界模型负责猜未来,可审计负责留证据;没有证据的聪明,很难被真正信任。
这也是为什么最近一些团队(如 Kepler)在挑战 ARC-AGI-3 这类交互式推理基准时,把"可审计"当成前提而不是附加项:这类基准考的是智能体在陌生环境里反复试错、建立世界模型并行动的能力。只报一个分数,外界无法分辨它是真推理还是碰巧试出来;留下可复盘的推演痕迹,评测才站得住。具体榜单与规则细节,以官方页面为准。
