跳到主内容
快讯直播
AI智模界
AI 词典

世界建模:让 Transformer 预演世界

一句话定义

世界建模(AI 词典:World Model">World Modeling)是指让 Transformer 在内部维护一份"环境现在是什么状态、某个动作会把它变成什么状态"的表示,从而预测环境下一步的样子,而不只是预测下一个词。

从"猜下一句台词"到"推演下一步棋"

大语言模型的训练目标很简单:给定前面的文字,猜下一个词(next-token prediction)。有意思的是,为了把这件事做好,模型不得不顺手学到一些世界规律——比如"杯子推到桌边会掉下去"。但这些规律是隐式的、被动的副产物,模型并不保证它自洽,也没人逼它把状态记准。

打个比方:看电视剧时,你只要猜下一句台词;玩模拟经营游戏时,你必须维护一个账本——现金多少、员工几个、库存几件,然后推演"我点下这个按钮,三步之后会怎样"。世界建模要的就是后者:把"猜台词"换成"维护账本并做沙盘推演"。

在 Transformer 里怎么做

常见有三条路子:

1. 把观测当 token:把图像帧、传感器读数、游戏画面压成向量序列,和动作一起喂给 Transformer,让它自回归地预测下一帧的压缩表示(潜空间预测),而不是还原像素。

2. 显式状态 token:把环境里可读的状态量(位置、电量、库存)也当成序列的一段,和动作、观测拼在一起训练,模型就学会了"状态如何随动作演化"。

3. 推理时 rollout:让模型在内部向前推演若干步,比较不同动作序列的结果,再决定真正执行哪一个。这时模型是"先想后做",而不是"边说边编"。

概念预测什么典型输出
语言建模下一个词一段文本
世界建模下一个环境状态状态或观测的表示
强化学习动作的价值一个策略

需要说明的是,世界模型在强化学习里早就有过,只是过去多用循环网络在小规模环境里跑;Transformer 带来的变化是更强的长程记忆和可并行训练,让"在想象中推演几十步"变得可行。

对从业者与普通人意味着什么

从业者会感受到三个变化:评估指标从"文字像不像人写的"变成"推演准不准";数据从"收集文本"转向"收集交互轨迹";调试重点从语言质量转向长程一致性。最大的坑是模型可能幻觉出一个自洽但错误的世界,然后在里面越走越偏,这也是目前最受关注的失效模式之一。

对普通人来说,这决定了 AI 能不能从"聊天"走向"做事":能在动手前先在脑子里预演一遍的模型,才适合驱动机器人、辅助驾驶、当游戏 NPC。具体能力边界与工程细节,以官方页面和技术文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。