世界模型开源潮:京东、高德、蚂蚁、大晓两天四连发,AI 开始生成「能走进去的世界」(2026年9月)
72 小时里,京东开源可交互视听世界模型 JoyAI-EchoWM,高德发布 3D 原生城市世界模型 ABot-Earth 0.7,蚂蚁灵波开放 1.3B 单卡实时版 LingBot-World,大晓开源统一多模态框架 Puffin-World,宇树同步公开 60 亿参数人形基座 UnifoLM-WLA-1.0。本文逐个拆解技术要点、硬件门槛与开源口径。
2026 年 9 月的第二个星期,国产 AI 的发布节奏从「卷大模型」切换成了「卷世界模型」。
9 月 9 日,京东全球科技探索者大会(JDD)上,京东探索研究院开源了可交互视听世界模型 JoyAI-EchoWM;9 月 10 日,高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7,同一天宇树公开了 60 亿参数的通用人形机器人基础模型 UnifoLM-WLA-1.0,蚂蚁灵波科技把 LingBot-World 2.0 的轻量版送上开源平台;9 月 11 日,大晓机器人联合南洋理工大学 S-Lab 开源统一多模态世界模型框架 Puffin-World。
四天、四款世界模型、一个具身基座,而且几乎全部选择开源。这不是巧合——是同一条技术路线在同一个时间窗口里集体交卷。下面把这批发布逐个拆开讲,说清楚它们各自解决了什么问题,以及为什么「世界模型」会在 2026 年被反复提起。
一、先把时间线理清楚
| 时间 | 发布方 | 成果 | 最关键的一句话 |
|---|---|---|---|
| 9 月 9 日 | 京东探索研究院 | JoyAI-EchoWM(开源)+ JoyAI-Echo 1.5 | 同一框架里同时生成画面、环境音、音乐、语音,并实时响应操作 |
| 9 月 10 日 | 高德(阿里巴巴) | ABot-Earth 0.7 | 一张卫星图或一段文字,消费级单卡约 10 分钟生成公里级 3D 城市 |
| 9 月 10 日 | 蚂蚁灵波科技 | LingBot-World 2.0 Small / Bidirectional / Causal Pretrain | 1.3B 参数把实时世界生成压进单张消费级显卡 |
| 9 月 10 日 | 宇树科技 | UnifoLM-WLA-1.0 | 60 亿参数人形基座,一套权重干 64 种活,宣称完全开源 |
| 9 月 11 日 | 大晓机器人 + 南洋理工 S-Lab | Puffin-World | 代码、模型、1500 万组三元组数据一起开源 |
五条发布挤在 72 小时里,覆盖了「可探索的虚拟世界」和「可驱动的物理世界」两头。放在一起看,就能看出这一波和去年的世界模型 Demo 有什么不一样。
二、京东 JoyAI-EchoWM:第一个「会发声、能回头」的可探索世界
过去一年,可交互世界生成的主线是画面质量:谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 把分钟级生成与精确相机控制结合起来,World Labs 的 Atlas 靠空间上下文沿指定相机轨迹生成新视角。但当用户真的在场景里反复走动,新的问题就来了——你改变路线、切换视角的时候,脚步声、环境声、人物说话声,能不能和画面一起连贯地接下去?
JoyAI-EchoWM 的核心卖点就在这里:它把视频、环境音、音乐和语音放进同一套框架联合生成,同时实时响应用户操作。技术上最关键的两点是:
- 统一「相机意图」接口。键盘或手柄的离散指令被映射成连续的六自由度轨迹,第一人称漫游和第三人称跟随共用同一套控制接口,不需要为每种视角单独准备角色轨道或预设跟随参数。
- 音频跟着场景事件走。相机路径条件化视觉分支,声音自然跟随脚步、碰撞、对话和配乐,不需要专门的动作到音频控制器。
在论文报告的 158 个 WBench Navigation 案例评测中,JoyAI-EchoWM 取得 81.7 的最高平均分,一致性 89.8、交互性 87.2 都排在前列;四步因果流式版本 EchoWM-Flash 平均分 81.0、交互得分 87.9,说明减少采样步数后导航响应能力基本保住了。训练侧则用了一套「世界数据引擎」,把游戏日志、真人游玩录像、虚幻引擎位姿真值仿真和互联网视频混在一起,再分视听预训练、动作微调、联合微调和自回归后训练四个阶段推进。
需要点明的是,团队自己也承认:模型目前没有显式的持久三维记忆,多轮探索时是靠一段短时尾随的视听窗口作为下一段的上下文,因此长时间操作后仍可能出现场景漂移。这是这批可交互世界模型的共性短板,不是 EchoWM 独有。
三、高德 ABot-Earth 0.7:一张卫星图,10 分钟长出一座城市
如果说京东在做「可以走进去的虚拟世界」,高德在做的是「可以走进去的真实世界」。
ABot-Earth 0.7 走的是3D 原生路线。过去二十年的数字地球,本质是把卫星影像、航拍和点云「拍下来再贴上去」,用户能看到什么、从哪里看,受既有素材和采集路径限制。ABot-Earth 0.7 改用包含空间、时间信息的时空数据训练模型,让它建立对三维空间的原生理解,然后端到端一次性生成 3DGS(三维高斯泼溅)格式的城市场景。
量化下来:输入一张卫星图像或一段文字描述,单块消费级 GPU 约 10 分钟生成公里级 3D 城市场景,效率比传统模式提升约 1000 倍,覆盖 196 个以上国家和地区;同一个模型能完成从星球、城市到街景地标的连续尺度生成,视角从城市全貌推进到地标近景时,路网关系、建筑轮廓、立面层次和材质纹理仍然保持一致。
它已经在实际产品里跑起来了:飞行街景 2.0、导航 Live、避雷指南都接入了这套世界模型能力,用户可以通过摇杆在 3D 场景里漫游复杂建筑和大型景区。高德 CEO 郭宁的表述很直白——「大模型理解语言,高德空间智能理解世界。」这句话基本定义了这波世界模型竞赛的另一条分支:不追求生成得漂亮,追求对物理空间的准确理解。
顺带提一句,站内已收录高德的这款世界模型工坊产品,可以直接体验:Abot-World。
四、蚂蚁灵波 LingBot-World 2.0 Small:1.3B 把实时世界抬进消费级单卡
蚂蚁灵波科技 7 月开源了 14B 的 LingBot-World 2.0 主模型,这次没有做大版本,而是补工具链——一次开放三款:
- Small(1.3B):面向消费级单卡 GPU,单卡即可实时世界生成。这是三款里最受关注的一个。
- Bidirectional(14B 双向 Teacher 模型):作为蒸馏源,通过一致性蒸馏加分布匹配蒸馏,把多步去噪轨迹压到少步 Student,同时抑制长时序自回归中的误差累积。
- Causal Pretrain(14B 因果预训练底座):支持相机位姿与文本提示双输入,既能控制移动和视角,也能用文本改变局部事件与世界状态。
技术上有两点值得关注:一是引入 MoBA(双向与自回归混合注意力掩码),在 Teacher Forcing 掩码里加入双向注意力组件,缓解纯 Teacher Forcing 带来的过拟合和画质下降;二是配套的因果交叉注意力,防止未来语义泄漏,同时保留交互控制能力。主模型本身支持小时级连续生成,可以响应攻击、射箭、施法、射击等角色动作和雨雪等环境事件,高算力配置下能到 720P / 60FPS,由 Pilot Agent 与 Director Agent 组成的交互框架维持世界持续演化。
一个必须提醒的点:许可口径不一致。官方项目页 FAQ 提到以 Apache 2.0 开源、可商用,但魔搭上的模型卡标注为 cc-by-nc-sa-4.0(非商用)。同一套权重出现两种说法,做商业化之前务必以官方仓库和模型卡的最新说明为准,不要凭印象判断。
无论如何,从 14B 下探到 1.3B 这件事本身就说明问题:世界模型正在从「只能看 Demo」走向「能在自己电脑上跑起来」。个人开发者和高校实验室第一次可以本地复现、改输入方式、测试不同的交互设计。
五、大晓 Puffin-World:把数据、标注和轨迹一起开源
大晓机器人联合南洋理工大学 S-Lab 等机构发布的 Puffin-World,走的是框架路线。它在同一套多模态框架里,把物理、几何和外观定义为三种原生的三维世界状态,用一个模型统一四类过去需要不同系统分别完成的任务:从单图理解相机物理信息、自由视点空间仿真、三维世界生成与重建、闭环自校准探索。核心能力是预测机器人行动之后世界将处于什么状态——这正是具身智能从「感知」走向「行动」需要的那一环。
比模型更值得注意的是它开源的东西:除了代码和模型,团队同步开放了 Puffin-16M 数据集,包含约 1500 万组视觉—语言—相机三元组、100 万条具有挑战性的旋转轨迹,以及覆盖 28 个公开数据集、约 4450 万张图像的绝对相机位姿标注。
「绝对位姿」这个词是这波数据开源里最容易被忽略、也最关键的一处。多数数据只描述视角之间的相对变化,模型学到的只是「相机从上一帧移动了多少」;Puffin-16M 额外引入了相机相对于重力方向和真实世界的绝对朝向,模型才可能理解「相机当前在世界中处于什么方向」。对机器人仿真和合成数据生产来说,这是能不能复现的分水岭。
六、宇树 UnifoLM-WLA-1.0:60 亿参数人形「大脑」,一套权重干 64 种活
同一天,宇树科技公开了新一代通用人形机器人基础模型 UnifoLM-WLA-1.0。这是一个 60 亿参数的视觉—语言—动作(VLA)基础模型,官方称代码、模型权重、数据集同步开放(截至 9 月 11 日官网相关入口仍显示 Coming soon,属于分批放量)。
它的结构可以概括为两层:底层是基于 Qwen3-VL-4B 的具身推理骨干 UnifoLM-ER-1,用了超过 500 万条具身样本协同训练,覆盖 3D 检测框、2D 轨迹预测、多图空间问答;上层是 MMDiT flow-based 动作专家,负责把手、夹爪和下半身关节的动作去噪输出。
两个设计细节值得单独说:
- 统一动作空间。末端位姿、手爪/灵巧手关节、下半身关节三路动作先经残差向量量化(RVQ)离散成动作词元,再统一进语言—视觉—动作框架。好处很直接:平行夹爪和两类灵巧手共用一套动作词汇,桌面臂和全身本体共享先验,换机身、换手爪不用重新采集数据重训。
- 动态区域预测。模型用前后帧光流提取「交互后会发生变化的区域」,再用 VQ-VAE 压成 Mask Token。也就是说,执行任务前它先预判自己这一动会让画面哪几块发生变化,再把这份变化先验送进动作生成。不预测整张未来图——因为机器人动手时真正变的往往只是桌面一角、一个杯口、一块毛巾边缘。官方的口号也压在这个逻辑上:Understand the World, Connect with Action。
评测口径上,宇树在 Unitree G1 平台的真机上做了 64 项任务,单模型不做任务特定微调即可完成:10 项全身移动操作(倒垃圾、把衣服放进洗衣机、铺床、取菜、整理鞋和沙发厨卫等)加 54 项桌面精细操作(叠毛巾、叠衣服、收纳餐盘、拧瓶盖、插线、电池充电等),并适配平行夹爪与两类灵巧手。具身推理骨干在 ROBOVQA、EGO-PLAN2、REF SPATIAL、WHERE2PLACE、PIXMO-POINT、BLINK 等评测中拿下 7 项开源第一,4B 的 ER 模型在 Spatial-Bench、Pixmo-Point、BLINK 等基准上超过了 RoboBrain2.0-7B、Pelican-7B、Cosmos-R1-7B 等更大规模的开源基线。
要冷静的是:2500 小时真机遥操作数据听起来很大,但相对家庭全场景仍然有限;评测第一也不等于入户零失误。真正该看的后续是三件事——权重开源的粒度、在 G1 等本体上的第三方复现、以及在灵巧手长尾任务上的泛化表现。
七、三款可交互世界模型横向对比
📊 下面这张信息图,把京东 JoyAI-EchoWM、高德 ABot-Earth 0.7 与蚂蚁 LingBot-World 2.0 Small 三款可交互世界模型放在同一组维度上对比。
| 维度 | 京东 JoyAI-EchoWM | 高德 ABot-Earth 0.7 | 蚂蚁 LingBot-World 2.0 Small |
|---|---|---|---|
| 发布时间 | 2026 年 9 月 9 日 | 2026 年 9 月 10 日 | 2026 年 9 月 10 日 |
| 世界类型 | 可探索的视听虚拟世界 | 真实世界的 3D 城市孪生 | 可交互的持续演化世界 |
| 输出形态 | 视频 + 环境音 + 音乐 + 语音 | 3DGS 三维高斯泼溅场景 | 实时生成画面(最高 720P / 60FPS) |
| 交互控制 | 统一相机意图:键盘 → 连续 6-DoF 轨迹 | 摇杆漫游,自由探索与实时反馈 | 相机位姿 + 文本提示双输入 |
| 硬件门槛 | 未公开,流式版本已做四步加速 | 单块消费级 GPU,约 10 分钟出结果 | 单张消费级 GPU 可实时运行 |
| 开源情况 | 已开源代码与论文 | 体验官网已上线,模型未开源 | 三款权重已上开源平台,许可口径待核 |
| 已知短板 | 无显式持久三维记忆,长时可能漂移 | 聚焦城市与地标尺度,非通用场景 | 从 14B 蒸馏而来,画质与主模型有差距 |
八、为什么集中在同一周爆发
把五条发布放在一起,能看到三条共同的底层逻辑。
第一,数据成本被摊薄了。过去做世界模型最贵的是「真机数据」——人示教、遥操作、试错、回收,机器时长和人工时长都算钱。宇树 2500 小时真机数据、大晓 1500 万组三元组,本质都是把攒了好几年的数据资产一次性放出来换取生态位。开源数据集,是在给整个行业降低边际成本,同时把自家格式变成事实标准。
第二,算力门槛快速下探。高德把公里级 3D 城市压进单卡 10 分钟,蚂蚁把实时世界生成压进 1.3B,京东用四步因果流式版保住 81.0 分。三家的方向一致:不追求在数据中心里刷最高画质,而是让能力跑在开发者手边的硬件上。这和云端大模型的路线恰好相反——世界模型这一支,天生更依赖端侧和本地部署。
第三,评测口径开始收敛。WBench Navigation、Spatial-Bench、PIXMO-POINT、ROBOVQA 这些基准在近半年反复出现,横纵可比性比一年前强了很多。有了统一尺子,「谁第一」才成为一个可以被第三方验证的命题,这也是开源权重敢往外放的前提。
九、对开发者和普通用户意味着什么
对开发者来说,这一波最实际的变化是可以本地跑了。1.3B 的世界模型、单卡 10 分钟的 3D 城市生成,意味着原型验证不再需要排队等集群。做机器人仿真、合成数据生产、虚拟场景搭建、影视分镜预演的小团队,第一次可以在自己的机器上把链路走通。
对内容创作者来说,变化在「可探索」这三个字。传统的视频生成是「输入提示词、等输出」的一次性过程,比如 可灵AI、即梦AI、Runway、Sora 这一批工具,产出都是一段固定的片子;而世界模型是按交互持续生成——人往前走一步,模型接着生成下一步。对游戏原型、文旅展示、虚拟拍摄来说,这是完全不同的工作方式。
对普通用户,短期内能摸到的是高德的 Abot-World 这类产品:打开网页,输入一段描述或者拖一张卫星图,10 分钟后就能在 3D 城市里漫游。真正走进家庭的人形机器人仍需要时间,但宇树的 H1、GD01 这类本体背后的「大脑」正在快速通用化——这才是决定机器人能不能干杂活的关键变量。
如果你是想上手的开发者,底层模型能力仍然绕不开大模型这一层。国产第一梯队的 Qwen3.8-Max、DeepSeek、智谱 GLM 5.3、Gemini 都在快速迭代,宇树这次的具身推理骨干就直接建在 Qwen3-VL-4B 上——世界模型不是要取代语言模型,而是把语言模型的空间理解能力补齐到「能动手」的程度。做 Agent 工作流的话,Qwen-Agent 这类框架可以作为起点。
十、冷静看:还有三个没解决的问题
- 持久记忆缺失。京东自己承认无显式持久三维记忆,长时生成会漂移。用户走远、回头、再折返,场景能不能还在原地,目前靠的是短时上下文窗口,不是空间记忆。
- 真机泛化没有被第三方验证。64 项任务、7 项评测第一都来自官方口径,权重尚未全部放出、第三方复现还没出现。评测分数和入户零失误之间的距离,靠的是长尾场景的积累,不是基准排名。
- 许可与合规口径混乱。LingBot-World 2.0 的许可在官方 FAQ 与模型卡之间出现冲突,Puffin-World 虽标注开源但商用条款需逐条确认。世界模型涉及机器人控制与仿真数据,商业使用前建议把许可、数据来源和出口合规一起过一遍。
十一、三句话总结
- 72 小时内京东、高德、蚂蚁、大晓四款世界模型集中发布,宇树同步开源 60 亿参数具身基座——2026 年是「世界模型元年」这个说法,正在被具体的发布时间表兑现。
- 方向已经分叉:一路做可探索的虚拟世界(京东、蚂蚁),一路做真实空间的准确理解(高德、大晓),汇合点是具身智能的行动能力(宇树)。
- 最值得关注的不是跑分,而是门槛——1.3B 单卡实时、单卡 10 分钟出公里级 3D 城市,说明世界模型正在从实验室 Demo 变成开发者手边可以跑的工具。
以上信息整理自各厂商官方发布、技术报告与公开媒体报道,模型参数、评测数据、开源许可与可用性请以各官方仓库与官网为准。