世界模型成2026具身智能核心引擎:腾讯、小米、智源、智元、星尘五大世界模型横评——AI从「会聊」到「会想物理世界」(2026年7月)

· AI评测 · · 📖 阅读时长 11 分钟
世界模型成2026具身智能核心引擎:腾讯、小米、智源、智元、星尘五大世界模型横评——AI从「会聊」到「会想物理世界」(2026年7月) - 数据对比信息图
世界模型成2026具身智能核心引擎:腾讯、小米、智源、智元、星尘五大世界模型横评——AI从「会聊」到「会想物理世界」(2026年7月) · 核心数据一览
⚡ TL;DR
2026年7月,腾讯、小米、智源、智元、星尘两周内集中发布五款世界模型。本文同维度横评五大世界模型,解释世界模型如何把AI从「会聊」推向「会想物理世界」,以及它对开发者和普通人的真实影响。
🕒 数据截至 2026-07-20 · 综合 WAIC 2026 现场报道、腾讯/小米/智源/智元/星尘官方发布与第三方评测
一句话结论: 2026年7月,世界模型(World Model)突然成为中国具身智能赛道的"标配"——腾讯、小米、智源、智元、星尘在两周内集中发布五款世界模型。本文把它们同维度横评,并解释为什么"让AI会想物理世界"比"让AI会聊天"更难,也更接近通用人工智能。

一、WAIC 2026 最大的认知刷新,不是机器人

今年 WAIC,展厅里机器人确实多到让人眼花:调酒的、搬箱的、叠衣服的、甚至能陪你聊二次元的。但如果你只盯着铁疙瘩,就错过了一件事——

真正的拐点发生在软件层。过去一年里,最聪明的 ChatGPTClaude 本质上还是"缸中之脑":它们能写诗、能推理、能答遍天下问题,却不知道一个杯子摔下去会碎、不知道"把水递给我"需要先转身再伸手。

而 2026 年 7 月,中国至少有五家团队在同一时间,把赌注压在了一个新概念上:世界模型(World Model)——让 AI 不仅能"聊",还能在脑子里"模拟"物理世界的运转。

二、什么是世界模型?从"预测下一个 token"到"预测下一个世界状态"

要理解世界模型,先得理解今天所有大模型的共同逻辑:

  • 语言模型:预测"下一个字符"
  • 视频模型:预测"下一帧画面"
  • 机器人模型:预测"下一个动作"

这三种预测都是单模态的、割裂的。而世界模型的核心突破,是把它们统一成一个目标——预测"下一个世界状态"

换句话说,世界模型不只在生成文字或画面,它在脑海里构建了一个"虚拟世界":输入一段视频、一张图、一句指令,它能推演出"接下来会发生什么""如果我这么做,结果会怎样"。

智源研究院发布的 RoboBrain Orca 把这句话写成了口号:"The World is in Your Mind"(世界在你心中)。这不是文艺修辞,而是技术路线:用统一的潜在表征空间,把物体的运动规律、场景的演变逻辑、动作的因果关系,全部装进同一个"脑海世界"。

三、为什么是 2026?"缸中之脑"的困境

腾讯首席科学家、Robotics X 实验室主任张正友在 WAIC 论坛上点破了一个残酷事实:

"今天最聪明的人工智能本质上仍是'缸中之脑'——它善于逻辑推理、文本生成和知识问答,却缺乏与物理世界直接互动的闭环。"

他补了一句更尖锐的:"语言并不等于全部认知,它只是智能向外表达的一个通道。"

这正是世界模型这一年突然爆发的底层原因。当大模型在语言榜单上已经卷到天花板,行业开始意识到:真正的瓶颈不在"说",而在"做"——而"做"的前提,是 AI 必须先"想清楚"物理世界的因果。

四、五款中国世界模型横评

两周之内,五款世界模型集中亮相。先把它们摊在一张表里看全貌:

模型机构参数开源核心架构标志性能力
腾讯 Hy-Embodied-RxBrain-1.0腾讯 Robotics X + 混元未公开(混元A3B底座)是(VLM+RxBrain)VLM+RxBrain+VLA 三件套感知-身体-行动闭环
小米 Xiaomi-Robotics-U0小米机器人380亿统一自回归数据永动机(OOD+26.3%)
智源 RoboBrain Orca北京智源研究院未公开未明确统一世界潜在表征世界状态推演预测
智元 GE-2智元机器人未公开否(竞赛冠军)世界模型+闭环强化World Arena 冠军
星尘 Lumo-2星尘智能基于 Qwen-3.5 4B隐式世界-动作模型22 项家务自动化

下面逐个拆开看。

1. 腾讯 Hy-Embodied:把"大脑"拆成左右脑+小脑

腾讯这次一口气发了三件套,全部基于 腾讯混元 大模型打造:

  • Hy-Embodied-VLM-1.0("右脑"):负责理解图像、空间、场景,用 1/10 的计算量达到上一代旗舰效果;
  • Hy-Embodied-RxBrain-1.0("大脑"):统一认知、规划、对未来的想象,基于 5 万+小时具身数据训练;
  • Hy-Embodied-VLA-0.5("小脑"):把高层目标翻译成连续、可纠错的身体动作。

再加上两个智能体 Apexio 和 TairosAgent 做调度,机器人第一次形成了"持续感知—持续决策—持续行动"的完整闭环。VLM 和 RxBrain 已经开源,开发者可以直接拉下来部署。

2. 小米 U0:机器人界的"数据永动机"

小米扔出的这颗"核弹"最硬核的地方,不是 380 亿参数,而是一个数据引擎思路。

U0 基于 EMU3.5 和 千问 Qwen-3-32B 构建,采用统一自回归架构——生成图片、编辑图片、"脑补"机器人抓取物体的多视角场景,用的都是同一套"下一个 token"逻辑。它像一个"物理世界模拟器",能自动生成多视角一致、符合物理规律的机器人操作数据。

效果有多猛?用 U0 生成的数据增强训练后,一个叫 π₀.₅ 的机器人操作策略,在真实世界分布外(OOD)任务上的成功率,从 36.9% 直接飙到 63.2%——整整提升 26.3 个百分点。机器人苦等多年的"数据引擎",终于来了。

3. 智源 RoboBrain Orca:率先"推演世界状态"

智源跳出"单一模态预测"框架,确立"预测下一个世界状态"的核心目标。它用 12.5 万小时真实视频 + 1.6 亿条事件标注训练,设计了"有意识/无意识"双路径:无意识路径靠海量视频自学物体掉落、移动等客观规律;有意识路径靠标注数据学明确的语义状态转换。

4. 智元 GE-2:从"世界模拟"到"世界学习"

智元机器人 的 GE-2 登顶 2026 World Arena 世界模型赛道总分冠军,实现从"世界模拟"到"世界学习"的升级,为机器人迭代提供闭环环境;再配上 Genie Evolver 1.0 真机强化学习系统,让机器人在实践中持续进化。它驱动的全尺寸人形机器人 A3 Ultra,被评为 WAIC"镇馆之宝"。

5. 星尘 Lumo-2:隐式世界-动作模型干家务

星尘智能的 Lumo-2 是业界首个家庭"隐式世界-动作模型",一次性展示机器人自主完成的 22 项复杂家务——煎蛋颠锅、调酒、熨衣、整理书包、拆包泡茶。它的范式是"先预测未来世界,再生成动作",在轻量物理潜在空间中以最小计算成本实现类世界模型效果。

五、横向对比:开源、参数、落地三道分水岭

把五款模型摊开看,三条分水岭很清楚:

  • 开源 vs 闭源:目前只有腾讯(VLM+RxBrain)和小米(U0)明确开源,智源、智元、星尘暂未开放权重——开源派抢的是开发者生态,闭源派守的是技术壁垒。
  • 参数 vs 架构:小米 380 亿、其余多未公开;但参数量已不是唯一标尺,DeepSeekKimi 的教训是——架构效率和数据配方更重要。
  • demo vs 落地:智元 A3 Ultra 已在京东物流仓储真实部署,星尘给出家庭方案,腾讯/小米以开源可部署为主,智源仍在研究院阶段。

六、对开发者和普通人意味着什么

  • 对开发者:世界模型开源(腾讯、小米)意味着你不用从零训机器人大脑,直接基于 腾讯混元 或 U0 底座做微调,就能让机械臂学会新动作。门槛从"养一支算法团队"降到"会部署+会调参"。
  • 对普通人:当机器人能"想清楚"物理世界,它才真正从展厅走进你家。一句"我渴了"就能递水、今天进厂明天熟练工,不再是 PPT 里的故事。

七、三个判断:世界模型将如何重塑 AI 工具

  • "缸中之脑"时代正在落幕。未来的 AI 对话 工具会悄悄接入世界模型,回答"杯子会不会碎"这类问题时不再瞎编。
  • 具身智能会成为下一个 App Store。谁的世界模型生态先聚拢开发者,谁就掌握机器人时代的"操作系统"话语权——腾讯、小米已经在抢跑。
  • 开源 vs 闭源的战争烧到物理世界。就像 智谱清言阶跃星辰 在语言模型上的路线之争,世界模型也会分裂成两派。

八、诚实的边界

世界模型不是银弹。当前五款模型大多仍在"特定任务"层面验证,跨场景泛化、长程因果、安全风险验证都还有待攻坚。张正友也提醒:模型不等于大脑,堆技能堆不出真正的智能。2026 是"世界模型元年",但离"通用机器人大脑"还有距离。

常见问题(FAQ)

Q1:世界模型和普通大模型有什么区别? 普通大模型预测文字/画面/动作等单模态输出;世界模型统一预测"下一个世界状态",能推演物理世界的演化。

Q2:哪些世界模型已经开源? 截至 2026-07-20,腾讯 Hy-Embodied(VLM+RxBrain)和小米 U0 已开源,开发者可下载部署。

Q3:普通人现在能用上吗? 直接调用仍需开发能力;但搭载这些模型的机器人(如智元 A3 Ultra)已开始真实部署,消费级产品预计 1–2 年内落地。

Q4:世界模型会让 AI 对话工具变聪明吗? 会。接入世界模型后,对话工具能获得物理常识,减少"一本正经胡说八道"。

关于作者:本文由 AI工具宝箱编辑组 撰写,团队 5+ 年 AI 工具付费实测经验,月均订阅支出 $200+,所有评测基于真实付费长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。