世界模型(World Model)是指能够理解物理世界因果规律并预测未来状态的 AI 模型。与语言模型不同,世界模型秒懂「杯子掉落会碎」「水会向低处流」「阳光照射会产生阴影」这样的物理常识。
核心能力
- 状态预测:给定当前状态 + 动作,预测下一个状态(如:推一个木块,它会怎样移动)
- 反事实推理:给定当前状态和目标状态,推理需要什么动作
- 多模态理解:同时处理视觉、力学、声音等多种物理信息
主要应用
- 视频生成:Sora(OpenAI)、Veo 2(Google)、Kling 2(快手)等视频生成模型都基于世界模型思想——理解物体在时空中如何变化
- 机器人:在仿真环境中训练,预测动作后果,降低真实世界试错成本(Sim-to-Real)
- 自动驾驶:预测其他车辆和行人的运动轨迹
关键论文与产品
- David Ha & Jurgen Schmidhuber(2018):《World Models》论文,使用 VAE+RNN 简单架构在游戏环境中实现
- Sora(OpenAI, 2024.2):基于 Diffusion Transformer,展示了大规模世界模型的潜力
- 李飞飞(世界模型创业):2024 年融资超 2 亿美元,研发专用于物理世界理解的大模型
与具身智能的关系
世界模型是具身智能的「大脑」——理解物理规律;机器人是具身智能的「身体」——执行物理动作。两者结合才能实现真正的智能机器人。