空间智能(Spatial Intelligence)指AI对三维世界的理解与互动能力——判断物体的形状、位置、运动,推理空间关系,并在真实或虚拟环境中采取行动。斯坦福大学教授李飞飞把它视为AI「理解三维世界」的关键一跃,并于2024年创立World Labs,公开押注这一方向。
为什么重要
- 当前大模型擅长处理文字和平面图像,但真实世界是三维、动态、有物理规律的
- 如果把语言理解比作「一维」(按顺序展开),平面视觉是「二维」,空间智能则是「三维加时间与物理」
- 它是机器人、自动驾驶、具身智能等「动手干活」的AI共同的底层能力
- 三维感知:从图像或视频估计物体的深度、尺寸、朝向
- 空间推理:理解「杯子在桌边」「门从左边开」这类空间关系
- 动作规划:根据空间理解规划抓取、移动、导航等行为
- 场景生成:生成可探索、可交互的三维世界
- World Labs致力于生成「可进入、可交互」的3D世界,输入一张图即可进入三维空间漫游
- 机器人领域兴起的视觉语言动作模型(VLA),把空间理解直接接到机械臂和机器人本体上
- 自动驾驶、AR与VR头显的空间感知能力也在快速进步
- 空间智能被视为通用人工智能(AGI)的重要拼图,2026年正处于从论文走向产品的转化期。