一句话定义
世界建模(AI 词典:World Model">World Modeling)是指让 Transformer 在内部维护一份"环境现在是什么状态、某个动作会把它变成什么状态"的表示,从而预测环境下一步的样子,而不只是预测下一个词。
从"猜下一句台词"到"推演下一步棋"
大语言模型的训练目标很简单:给定前面的文字,猜下一个词(next-token prediction)。有意思的是,为了把这件事做好,模型不得不顺手学到一些世界规律——比如"杯子推到桌边会掉下去"。但这些规律是隐式的、被动的副产物,模型并不保证它自洽,也没人逼它把状态记准。
打个比方:看电视剧时,你只要猜下一句台词;玩模拟经营游戏时,你必须维护一个账本——现金多少、员工几个、库存几件,然后推演"我点下这个按钮,三步之后会怎样"。世界建模要的就是后者:把"猜台词"换成"维护账本并做沙盘推演"。
在 Transformer 里怎么做
常见有三条路子:
1. 把观测当 token:把图像帧、传感器读数、游戏画面压成向量序列,和动作一起喂给 Transformer,让它自回归地预测下一帧的压缩表示(潜空间预测),而不是还原像素。
2. 显式状态 token:把环境里可读的状态量(位置、电量、库存)也当成序列的一段,和动作、观测拼在一起训练,模型就学会了"状态如何随动作演化"。
3. 推理时 rollout:让模型在内部向前推演若干步,比较不同动作序列的结果,再决定真正执行哪一个。这时模型是"先想后做",而不是"边说边编"。
| 概念 | 预测什么 | 典型输出 |
|---|---|---|
| 语言建模 | 下一个词 | 一段文本 |
| 世界建模 | 下一个环境状态 | 状态或观测的表示 |
| 强化学习 | 动作的价值 | 一个策略 |
需要说明的是,世界模型在强化学习里早就有过,只是过去多用循环网络在小规模环境里跑;Transformer 带来的变化是更强的长程记忆和可并行训练,让"在想象中推演几十步"变得可行。
对从业者与普通人意味着什么
从业者会感受到三个变化:评估指标从"文字像不像人写的"变成"推演准不准";数据从"收集文本"转向"收集交互轨迹";调试重点从语言质量转向长程一致性。最大的坑是模型可能幻觉出一个自洽但错误的世界,然后在里面越走越偏,这也是目前最受关注的失效模式之一。
对普通人来说,这决定了 AI 能不能从"聊天"走向"做事":能在动手前先在脑子里预演一遍的模型,才适合驱动机器人、辅助驾驶、当游戏 NPC。具体能力边界与工程细节,以官方页面和技术文档为准。
