世界模型开源潮:京东、高德、蚂蚁、大晓两天四连发,AI 开始生成「能走进去的世界」(2026年9月)

⚡ TL;DR
72 小时里,京东开源可交互视听世界模型 JoyAI-EchoWM,高德发布 3D 原生城市世界模型 ABot-Earth 0.7,蚂蚁灵波开放 1.3B 单卡实时版 LingBot-World,大晓开源统一多模态框架 Puffin-World,宇树同步公开 60 亿参数人形基座 UnifoLM-WLA-1.0。本文逐个拆解技术要点、硬件门槛与开源口径。

2026 年 9 月的第二个星期,国产 AI 的发布节奏从「卷大模型」切换成了「卷世界模型」。

9 月 9 日,京东全球科技探索者大会(JDD)上,京东探索研究院开源了可交互视听世界模型 JoyAI-EchoWM;9 月 10 日,高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7,同一天宇树公开了 60 亿参数的通用人形机器人基础模型 UnifoLM-WLA-1.0,蚂蚁灵波科技把 LingBot-World 2.0 的轻量版送上开源平台;9 月 11 日,大晓机器人联合南洋理工大学 S-Lab 开源统一多模态世界模型框架 Puffin-World

四天、四款世界模型、一个具身基座,而且几乎全部选择开源。这不是巧合——是同一条技术路线在同一个时间窗口里集体交卷。下面把这批发布逐个拆开讲,说清楚它们各自解决了什么问题,以及为什么「世界模型」会在 2026 年被反复提起。

一、先把时间线理清楚

时间发布方成果最关键的一句话
9 月 9 日京东探索研究院JoyAI-EchoWM(开源)+ JoyAI-Echo 1.5同一框架里同时生成画面、环境音、音乐、语音,并实时响应操作
9 月 10 日高德(阿里巴巴)ABot-Earth 0.7一张卫星图或一段文字,消费级单卡约 10 分钟生成公里级 3D 城市
9 月 10 日蚂蚁灵波科技LingBot-World 2.0 Small / Bidirectional / Causal Pretrain1.3B 参数把实时世界生成压进单张消费级显卡
9 月 10 日宇树科技UnifoLM-WLA-1.060 亿参数人形基座,一套权重干 64 种活,宣称完全开源
9 月 11 日大晓机器人 + 南洋理工 S-LabPuffin-World代码、模型、1500 万组三元组数据一起开源

五条发布挤在 72 小时里,覆盖了「可探索的虚拟世界」和「可驱动的物理世界」两头。放在一起看,就能看出这一波和去年的世界模型 Demo 有什么不一样。

二、京东 JoyAI-EchoWM:第一个「会发声、能回头」的可探索世界

过去一年,可交互世界生成的主线是画面质量:谷歌 DeepMind 的 Genie 3 展示了实时探索与分钟级一致性,英伟达 SANA-WM 把分钟级生成与精确相机控制结合起来,World Labs 的 Atlas 靠空间上下文沿指定相机轨迹生成新视角。但当用户真的在场景里反复走动,新的问题就来了——你改变路线、切换视角的时候,脚步声、环境声、人物说话声,能不能和画面一起连贯地接下去?

JoyAI-EchoWM 的核心卖点就在这里:它把视频、环境音、音乐和语音放进同一套框架联合生成,同时实时响应用户操作。技术上最关键的两点是:

    • 统一「相机意图」接口。键盘或手柄的离散指令被映射成连续的六自由度轨迹,第一人称漫游和第三人称跟随共用同一套控制接口,不需要为每种视角单独准备角色轨道或预设跟随参数。
    • 音频跟着场景事件走。相机路径条件化视觉分支,声音自然跟随脚步、碰撞、对话和配乐,不需要专门的动作到音频控制器。

在论文报告的 158 个 WBench Navigation 案例评测中,JoyAI-EchoWM 取得 81.7 的最高平均分,一致性 89.8、交互性 87.2 都排在前列;四步因果流式版本 EchoWM-Flash 平均分 81.0、交互得分 87.9,说明减少采样步数后导航响应能力基本保住了。训练侧则用了一套「世界数据引擎」,把游戏日志、真人游玩录像、虚幻引擎位姿真值仿真和互联网视频混在一起,再分视听预训练、动作微调、联合微调和自回归后训练四个阶段推进。

需要点明的是,团队自己也承认:模型目前没有显式的持久三维记忆,多轮探索时是靠一段短时尾随的视听窗口作为下一段的上下文,因此长时间操作后仍可能出现场景漂移。这是这批可交互世界模型的共性短板,不是 EchoWM 独有。

三、高德 ABot-Earth 0.7:一张卫星图,10 分钟长出一座城市

如果说京东在做「可以走进去的虚拟世界」,高德在做的是「可以走进去的真实世界」。

ABot-Earth 0.7 走的是3D 原生路线。过去二十年的数字地球,本质是把卫星影像、航拍和点云「拍下来再贴上去」,用户能看到什么、从哪里看,受既有素材和采集路径限制。ABot-Earth 0.7 改用包含空间、时间信息的时空数据训练模型,让它建立对三维空间的原生理解,然后端到端一次性生成 3DGS(三维高斯泼溅)格式的城市场景。

量化下来:输入一张卫星图像或一段文字描述,单块消费级 GPU 约 10 分钟生成公里级 3D 城市场景,效率比传统模式提升约 1000 倍,覆盖 196 个以上国家和地区;同一个模型能完成从星球、城市到街景地标的连续尺度生成,视角从城市全貌推进到地标近景时,路网关系、建筑轮廓、立面层次和材质纹理仍然保持一致。

它已经在实际产品里跑起来了:飞行街景 2.0、导航 Live、避雷指南都接入了这套世界模型能力,用户可以通过摇杆在 3D 场景里漫游复杂建筑和大型景区。高德 CEO 郭宁的表述很直白——「大模型理解语言,高德空间智能理解世界。」这句话基本定义了这波世界模型竞赛的另一条分支:不追求生成得漂亮,追求对物理空间的准确理解。

顺带提一句,站内已收录高德的这款世界模型工坊产品,可以直接体验:Abot-World

四、蚂蚁灵波 LingBot-World 2.0 Small:1.3B 把实时世界抬进消费级单卡

蚂蚁灵波科技 7 月开源了 14B 的 LingBot-World 2.0 主模型,这次没有做大版本,而是补工具链——一次开放三款:

    • Small(1.3B):面向消费级单卡 GPU,单卡即可实时世界生成。这是三款里最受关注的一个。
    • Bidirectional(14B 双向 Teacher 模型):作为蒸馏源,通过一致性蒸馏加分布匹配蒸馏,把多步去噪轨迹压到少步 Student,同时抑制长时序自回归中的误差累积。
    • Causal Pretrain(14B 因果预训练底座):支持相机位姿与文本提示双输入,既能控制移动和视角,也能用文本改变局部事件与世界状态。

技术上有两点值得关注:一是引入 MoBA(双向与自回归混合注意力掩码),在 Teacher Forcing 掩码里加入双向注意力组件,缓解纯 Teacher Forcing 带来的过拟合和画质下降;二是配套的因果交叉注意力,防止未来语义泄漏,同时保留交互控制能力。主模型本身支持小时级连续生成,可以响应攻击、射箭、施法、射击等角色动作和雨雪等环境事件,高算力配置下能到 720P / 60FPS,由 Pilot Agent 与 Director Agent 组成的交互框架维持世界持续演化。

一个必须提醒的点:许可口径不一致。官方项目页 FAQ 提到以 Apache 2.0 开源、可商用,但魔搭上的模型卡标注为 cc-by-nc-sa-4.0(非商用)。同一套权重出现两种说法,做商业化之前务必以官方仓库和模型卡的最新说明为准,不要凭印象判断。

无论如何,从 14B 下探到 1.3B 这件事本身就说明问题:世界模型正在从「只能看 Demo」走向「能在自己电脑上跑起来」。个人开发者和高校实验室第一次可以本地复现、改输入方式、测试不同的交互设计。

五、大晓 Puffin-World:把数据、标注和轨迹一起开源

大晓机器人联合南洋理工大学 S-Lab 等机构发布的 Puffin-World,走的是框架路线。它在同一套多模态框架里,把物理、几何和外观定义为三种原生的三维世界状态,用一个模型统一四类过去需要不同系统分别完成的任务:从单图理解相机物理信息、自由视点空间仿真、三维世界生成与重建、闭环自校准探索。核心能力是预测机器人行动之后世界将处于什么状态——这正是具身智能从「感知」走向「行动」需要的那一环。

比模型更值得注意的是它开源的东西:除了代码和模型,团队同步开放了 Puffin-16M 数据集,包含约 1500 万组视觉—语言—相机三元组、100 万条具有挑战性的旋转轨迹,以及覆盖 28 个公开数据集、约 4450 万张图像的绝对相机位姿标注。

「绝对位姿」这个词是这波数据开源里最容易被忽略、也最关键的一处。多数数据只描述视角之间的相对变化,模型学到的只是「相机从上一帧移动了多少」;Puffin-16M 额外引入了相机相对于重力方向和真实世界的绝对朝向,模型才可能理解「相机当前在世界中处于什么方向」。对机器人仿真和合成数据生产来说,这是能不能复现的分水岭。

六、宇树 UnifoLM-WLA-1.0:60 亿参数人形「大脑」,一套权重干 64 种活

同一天,宇树科技公开了新一代通用人形机器人基础模型 UnifoLM-WLA-1.0。这是一个 60 亿参数的视觉—语言—动作(VLA)基础模型,官方称代码、模型权重、数据集同步开放(截至 9 月 11 日官网相关入口仍显示 Coming soon,属于分批放量)。

它的结构可以概括为两层:底层是基于 Qwen3-VL-4B 的具身推理骨干 UnifoLM-ER-1,用了超过 500 万条具身样本协同训练,覆盖 3D 检测框、2D 轨迹预测、多图空间问答;上层是 MMDiT flow-based 动作专家,负责把手、夹爪和下半身关节的动作去噪输出。

两个设计细节值得单独说:

    • 统一动作空间。末端位姿、手爪/灵巧手关节、下半身关节三路动作先经残差向量量化(RVQ)离散成动作词元,再统一进语言—视觉—动作框架。好处很直接:平行夹爪和两类灵巧手共用一套动作词汇,桌面臂和全身本体共享先验,换机身、换手爪不用重新采集数据重训。
    • 动态区域预测。模型用前后帧光流提取「交互后会发生变化的区域」,再用 VQ-VAE 压成 Mask Token。也就是说,执行任务前它先预判自己这一动会让画面哪几块发生变化,再把这份变化先验送进动作生成。不预测整张未来图——因为机器人动手时真正变的往往只是桌面一角、一个杯口、一块毛巾边缘。官方的口号也压在这个逻辑上:Understand the World, Connect with Action。

评测口径上,宇树在 Unitree G1 平台的真机上做了 64 项任务,单模型不做任务特定微调即可完成:10 项全身移动操作(倒垃圾、把衣服放进洗衣机、铺床、取菜、整理鞋和沙发厨卫等)加 54 项桌面精细操作(叠毛巾、叠衣服、收纳餐盘、拧瓶盖、插线、电池充电等),并适配平行夹爪与两类灵巧手。具身推理骨干在 ROBOVQA、EGO-PLAN2、REF SPATIAL、WHERE2PLACE、PIXMO-POINT、BLINK 等评测中拿下 7 项开源第一,4B 的 ER 模型在 Spatial-Bench、Pixmo-Point、BLINK 等基准上超过了 RoboBrain2.0-7B、Pelican-7B、Cosmos-R1-7B 等更大规模的开源基线。

要冷静的是:2500 小时真机遥操作数据听起来很大,但相对家庭全场景仍然有限;评测第一也不等于入户零失误。真正该看的后续是三件事——权重开源的粒度、在 G1 等本体上的第三方复现、以及在灵巧手长尾任务上的泛化表现。

七、三款可交互世界模型横向对比

📊 下面这张信息图,把京东 JoyAI-EchoWM、高德 ABot-Earth 0.7 与蚂蚁 LingBot-World 2.0 Small 三款可交互世界模型放在同一组维度上对比。
世界模型开源潮:京东、高德、蚂蚁、大晓两天四连发,AI 开始生成「能走进去的世界」(2026年9月) - 数据对比信息图
世界模型开源潮:京东、高德、蚂蚁、大晓两天四连发,AI 开始生成「能走进去的世界」(2026年9月) · 核心数据一览

维度京东 JoyAI-EchoWM高德 ABot-Earth 0.7蚂蚁 LingBot-World 2.0 Small
发布时间2026 年 9 月 9 日2026 年 9 月 10 日2026 年 9 月 10 日
世界类型可探索的视听虚拟世界真实世界的 3D 城市孪生可交互的持续演化世界
输出形态视频 + 环境音 + 音乐 + 语音3DGS 三维高斯泼溅场景实时生成画面(最高 720P / 60FPS)
交互控制统一相机意图:键盘 → 连续 6-DoF 轨迹摇杆漫游,自由探索与实时反馈相机位姿 + 文本提示双输入
硬件门槛未公开,流式版本已做四步加速单块消费级 GPU,约 10 分钟出结果单张消费级 GPU 可实时运行
开源情况已开源代码与论文体验官网已上线,模型未开源三款权重已上开源平台,许可口径待核
已知短板无显式持久三维记忆,长时可能漂移聚焦城市与地标尺度,非通用场景从 14B 蒸馏而来,画质与主模型有差距

八、为什么集中在同一周爆发

把五条发布放在一起,能看到三条共同的底层逻辑。

第一,数据成本被摊薄了。过去做世界模型最贵的是「真机数据」——人示教、遥操作、试错、回收,机器时长和人工时长都算钱。宇树 2500 小时真机数据、大晓 1500 万组三元组,本质都是把攒了好几年的数据资产一次性放出来换取生态位。开源数据集,是在给整个行业降低边际成本,同时把自家格式变成事实标准。

第二,算力门槛快速下探。高德把公里级 3D 城市压进单卡 10 分钟,蚂蚁把实时世界生成压进 1.3B,京东用四步因果流式版保住 81.0 分。三家的方向一致:不追求在数据中心里刷最高画质,而是让能力跑在开发者手边的硬件上。这和云端大模型的路线恰好相反——世界模型这一支,天生更依赖端侧和本地部署。

第三,评测口径开始收敛。WBench Navigation、Spatial-Bench、PIXMO-POINT、ROBOVQA 这些基准在近半年反复出现,横纵可比性比一年前强了很多。有了统一尺子,「谁第一」才成为一个可以被第三方验证的命题,这也是开源权重敢往外放的前提。

九、对开发者和普通用户意味着什么

对开发者来说,这一波最实际的变化是可以本地跑了。1.3B 的世界模型、单卡 10 分钟的 3D 城市生成,意味着原型验证不再需要排队等集群。做机器人仿真、合成数据生产、虚拟场景搭建、影视分镜预演的小团队,第一次可以在自己的机器上把链路走通。

对内容创作者来说,变化在「可探索」这三个字。传统的视频生成是「输入提示词、等输出」的一次性过程,比如 可灵AI即梦AIRunwaySora 这一批工具,产出都是一段固定的片子;而世界模型是按交互持续生成——人往前走一步,模型接着生成下一步。对游戏原型、文旅展示、虚拟拍摄来说,这是完全不同的工作方式。

对普通用户,短期内能摸到的是高德的 Abot-World 这类产品:打开网页,输入一段描述或者拖一张卫星图,10 分钟后就能在 3D 城市里漫游。真正走进家庭的人形机器人仍需要时间,但宇树的 H1GD01 这类本体背后的「大脑」正在快速通用化——这才是决定机器人能不能干杂活的关键变量。

如果你是想上手的开发者,底层模型能力仍然绕不开大模型这一层。国产第一梯队的 Qwen3.8-MaxDeepSeek智谱 GLM 5.3Gemini 都在快速迭代,宇树这次的具身推理骨干就直接建在 Qwen3-VL-4B 上——世界模型不是要取代语言模型,而是把语言模型的空间理解能力补齐到「能动手」的程度。做 Agent 工作流的话,Qwen-Agent 这类框架可以作为起点。

十、冷静看:还有三个没解决的问题

    • 持久记忆缺失。京东自己承认无显式持久三维记忆,长时生成会漂移。用户走远、回头、再折返,场景能不能还在原地,目前靠的是短时上下文窗口,不是空间记忆。
    • 真机泛化没有被第三方验证。64 项任务、7 项评测第一都来自官方口径,权重尚未全部放出、第三方复现还没出现。评测分数和入户零失误之间的距离,靠的是长尾场景的积累,不是基准排名。
    • 许可与合规口径混乱。LingBot-World 2.0 的许可在官方 FAQ 与模型卡之间出现冲突,Puffin-World 虽标注开源但商用条款需逐条确认。世界模型涉及机器人控制与仿真数据,商业使用前建议把许可、数据来源和出口合规一起过一遍。

十一、三句话总结

    • 72 小时内京东、高德、蚂蚁、大晓四款世界模型集中发布,宇树同步开源 60 亿参数具身基座——2026 年是「世界模型元年」这个说法,正在被具体的发布时间表兑现。
    • 方向已经分叉:一路做可探索的虚拟世界(京东、蚂蚁),一路做真实空间的准确理解(高德、大晓),汇合点是具身智能的行动能力(宇树)。
    • 最值得关注的不是跑分,而是门槛——1.3B 单卡实时、单卡 10 分钟出公里级 3D 城市,说明世界模型正在从实验室 Demo 变成开发者手边可以跑的工具。

以上信息整理自各厂商官方发布、技术报告与公开媒体报道,模型参数、评测数据、开源许可与可用性请以各官方仓库与官网为准

关于作者:本文由 AI工具宝箱编辑组 撰写,团队持续追踪并实测主流 AI 工具,月均订阅支出 $200+,所有评测基于真实长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。