世界模型(World Model)是智能体(Agent)内部的一套环境模拟器:给定当前状态和它准备采取的动作,预测接下来环境会变成什么样。它回答的不是“我该做什么”,而是“如果我这么做,会发生什么”。
打个比方
下棋时,棋手会在脑中推演:我走马,对方可能飞象,我再进车。这个脑内棋盘就是世界模型。开车变道前,你也会预演:打灯、看后视镜、加速,后车会不会逼近。世界模型就是把这套“脑内预演”交给模型,让它可计算、可批量试错。
原理:状态 + 动作 → 下一个状态
形式上,世界模型学习一个预测函数:输入当前状态(画面、位置、库存、对话上下文等)和动作(移动、点击、下单、说话),输出下一步状态、观察,有时还包括奖励或终止信号。它可以用真实交互数据训练,也可以在“潜空间”里压缩表示,让预测更稳定。学会后,智能体就能在模型里“想象”多条未来路径,挑一条好的再执行。这就是基于模型的强化学习(Model-Based Reinforcement Learning)和规划的核心。
和相邻概念的区别
| 概念 | 核心问题 | 与世界模型的关系 |
|---|---|---|
| 大语言模型(LLM) | 下一个词是什么 | 可学语言与社会规律,但默认不显式建模动作后果 |
| 仿真器(Simulator) | 按物理规则算出结果 | 常由人写规则;世界模型多从数据中学 |
| 视频生成模型 | 下一帧像什么 | 画面逼真不等于动作可控、因果一致 |
| 策略(Policy) | 我该做什么 | 策略做决定,世界模型预测后果,二者可配合 |
实际意义
对 AI 从业者,世界模型能提升样本效率:少试错,多“脑补”;也便于安全评估,先模拟危险动作。对普通职场人,它意味着智能体不再只会条件反射,而能先推演再行动,例如办公助手先模拟批量改表后果,机器人先预判抓取是否碰倒杯子。不过它也有硬伤:预测误差会随步数累积,模型可能被规划器“钻空子”,遇到训练外情况会失真。因此实际系统常把想象与真实反馈结合,并给预测加上不确定性。具体能力以官方页面和实测为准。
