物理合理性指的是:AI 生成的内容——尤其是视频、3D 场景和机器人仿真环境——是否符合真实世界的物理规律。东西会掉下来,撞上会弹开,水往低处流,杯子能装住液体,影子的方向跟着光源走,物体不会凭空消失或穿墙。
它为什么是个独立的难题
现在的视频生成模型,本质是在做"预测下一帧长什么样"。它优化的是像素层面的"像",不是物理层面的"对"。想象一个只看过一百万场台球比赛录像、却从没摸过球杆的人:他能猜出球往哪边滚,但不知道球撞在一起时该停、该弹还是该碎。模型也一样,画面里绝大多数像素合理,分数就够看了,剩下的那点物理错误很容易被"抹平"。
更麻烦的是误差会累积。第一秒只是杯子轻微漂浮,第十秒它可能已经穿过了桌面。所以物理错误往往在长视频里才暴露出来。
和几个相邻概念的区别
很多人把物理合理性和画质、时序连贯混为一谈,其实它们各管一段。
| 维度 | 它关心什么 | 典型失效表现 |
|---|---|---|
| 视觉真实感 | 单帧画质与纹理 | 塑料感、糊成一团 |
| 时空一致性 | 跨帧是否稳定 | 人物换脸、画面闪烁 |
| 语义对齐 | 是否符合提示词 | 要红杯子给了蓝的 |
| 物理合理性 | 事件是否符合规律 | 穿模、悬空、水倒流 |
一个视频可以画质极好、人物始终是同一个人、也严格按提示词生成了"倒水",但水从杯底往上流——前三项全过,第四项挂掉。
评测为什么开始盯这个
早期评测主要看得分和人工观感,而人类观众很容易被"画面漂亮、动作流畅"带着走,忽略物理破绽。问题在于:一个穿模的视频,在只测画质或语义的指标上可能依然得分很高。于是评测开始单独立项——检查物体恒存性、碰撞响应、重力与支撑、流体行为、因果顺序。有些基准会专门设计"推倒积木""倒水""切水果"这类场景,看模型在第几秒崩。具体榜单和分数变化很快,以官方页面为准。
对从业者和普通人的意义
做生成模型的人,等于多了一条验收线:不能只看画面好不好看,还要看它错在哪一帧、为什么错。常见思路是把物理先验、3D 表示、可微仿真这些手段引进来,让模型不只是"见过",而是"知道会发生什么"。
普通职场人则多一条判断标准:演示视频流畅不等于可用。做电商、营销、培训素材时,一个悬浮的杯子或穿墙的手臂,足以让观众瞬间出戏、不再信任内容。而如果未来要让机器人在仿真里学做事,物理合理性就不是"好不好看"的问题——世界模型里闯的祸,会原样搬到真实世界。
