谷歌给机器人装上"会自己纠错的大脑":Gemini Robotics ER 2 发布,具身推理让机器人在犯错时自己喊停(2026年7月)
7月30日 Google DeepMind 发布 Gemini Robotics ER 2——机器人的「具身推理大脑」,能看视频流自纠错(进度分类57.4%、关键时刻定位91.3%)、边执行边规划(亚秒延迟、4倍速)、支持多机协作。与国产世界模型是什么关系?一文说清。
🕒 数据截至 2026-07-31,编辑组综合 Google DeepMind 官方博客(7月30日)与 IT之家、华尔街见闻等公开报道整理。本文聚焦"机器人 AI 大脑"这一具身智能最关键的 Runtime 层,不重复我们此前的世界模型文章角度。
一、开篇:机器人第一次有了"元认知"
7月30日,Google DeepMind 扔出一颗具身智能的"深水炸弹"——Gemini Robotics ER 2。DeepMind 给它的定位很直白:这是机器人的"高级大脑"(high-level brain),负责协调三件事:理解人类在说什么、理解物理世界正在发生什么、规划多步任务并把它拆给底层的"手脚"去执行。
听起来抽象?一个例子就够了:过去让机器人倒一杯咖啡,它往往是"盲人摸象"——执行完一步就卡住,出错就卡死,得人重来。ER 2 的突破在于,它能看着自己干活的过程,发现"倒多了"就自己停、自己改,而不是一根筋冲到底。
二、什么是"具身推理"(Embodied Reasoning)?
要理解 ER 2,得先分清机器人 AI 的两层:
- 底层 VLA(视觉-语言-动作)模型:负责"看到杯子→伸手→抓取"这种毫秒级具体动作,是机器人的"小脑和手"。
- ER 2(具身推理模型):站在 VLA 上面,负责"我为什么要倒这杯咖啡、现在该进哪一步、刚才那步是不是错了"。它是机器人的"大脑皮层"。
ER 2 不直接驱动关节,而是给底层 VLA 派活、控节奏、兜底纠错。这也是为什么 DeepMind 把它叫"推理"而非"控制"——它管的是决策与自我监控,不是力矩。
三、ER 2 的三大硬核升级
相比上一代 ER 1.6,ER 2 的进步不是"参数更大",而是"会看过程、会喊停、会并行想":
1. 连续视频流理解。 ER 2 能分析持续的视频流,实时跟踪任务进度。倒咖啡时它盯着液面,知道"还差一半";叠衣服时它知道"袖子还没对齐"。
2. 自纠错进度追踪。 在"任务进度分类"测试中,ER 2 准确率达 57.4%——意味着它能在不重启整个工作流的前提下,识别失败的步骤并调整重试。更惊艳的是"关键时刻定位(moment-finding)"测试:让模型判断"什么时候该停止往杯里倒咖啡",ER 2 准确率 91.3%,平均绝对时间误差仅 0.96 秒。
3. 边执行边规划。 传统机器人是"停—想—动"三段式,每次决策都要停顿。ER 2 接入 Gemini Live API 的双向流式端点,在机器人执行当前动作的同时,并行推理下一步,把停顿压到亚秒级。DeepMind 称其以更低计算成本达到接近更大模型的精度,执行速度是后者的 4 倍,且满足真实机器人安全所需的亚秒延迟。
四、全家桶:Gemini Robotics 2 三件套
ER 2 不是孤品,它是 Gemini Robotics 2 平台的一员。这次 DeepMind 一口气给了三件:
| 成员 | 定位 | 关键能力 |
|---|---|---|
| Gemini Robotics 2 | 全身控制 | 人形机器人从头到脚的全身控制 |
| Gemini Robotics ER 2 | 具身推理大脑 | 高层规划、自纠错、调度 VLA |
| Gemini Robotics On-Device 2 | 端侧部署 | 跑在机器人本地芯片,低延迟离线 |
一句话总结:Robotics 2 让机器人"会动全身",ER 2 让机器人"会想过程",On-Device 2 让机器人"不联网也能想"。
五、三大机器人 AI 大脑横评
把 ER 2 和国内两款具身智能代表放在一起看,格局立刻清晰(完整五强对比见文末表格):
- Gemini Robotics ER 2(Google):云端具身推理,唯一公开自纠错基准(57.4% / 91.3%),原生可调 Google Search 与自定义函数,支持多机协作。
- 智元 GE-2(智元机器人):国产具身世界模型,强在"预判物理世界"的规划层,与 ER 2 互补。
- 小米 U0(小米):国产具身世界模型,主打全身控制与世界模型预训练。
六、它和"世界模型"是什么关系?(说清边界,不撞车)
我们此前写过《世界模型成2026具身智能核心引擎》,腾讯、小米、智源、智元、星尘五款"世界模型"集中爆发。很多读者会问:ER 2 是不是又一个世界模型?
不是,它是世界模型的"执行搭档"。 打个比方:
- 世界模型是"模拟器"——在大脑里预演"如果我推一下杯子会怎样",负责预判。
- ER 2 是"调度台"——看着真实视频流判断"现在该进哪步、上一步错了没",负责实时监控与纠错。
两者不是竞争,而是上下游:世界模型给出"应该发生什么",ER 2 盯着"实际发生了什么"并兜底。这也是为什么 ER 2 能直接调用 Google Search——它需要实时知识补足"预判"的盲区。
七、多机协作:一台干不了的,两台接力
ER 2 另一个被低估的能力是多机器人协作。基于共享的语义理解,不同类型机器人能互相"交接任务"。DeepMind 演示了 Apptronik 的 Apollo 2 与 Franka 的 FR3 Duo 协作:一个负责大范围移动取物,一个负责精细操作,复杂工作流由两台设备接力完成——这是单台机器人做不到的。
八、开发者现在怎么用?
ER 2 已通过 Gemini API 和 Google AI Studio 向开发者公开提供;同时在 Gemini Enterprise Agent Platform 开启私密预览。上手路径很清晰:
- 在 AI Studio 调通 ER 2 的推理与视频流输入;
- 用官方示例代码接入你的 VLA 与机器人本体;
- 需要实时知识时,让 ER 2 原生调用 Google Search 或你的自定义函数。
对企业用户,Enterprise Agent Platform 的私密预览意味着可以把它嵌进工厂、仓储、巡检的真实流程,而不是停在 Demo。
九、对普通人意味着什么?
短期看,ER 2 还在"大脑层",离你家里端咖啡还有距离。但它的意义在于把机器人从"执行预设脚本"推向"理解过程、自我修正"——这是通用机器人真正可用的前提。当你家的扫地机器人不再卡在门槛上干嚎、而是自己绕路重试时,背后就是这类具身推理在起作用。
想了解背后的通用大模型能力,可以看我们的 Google Gemini、通义千问、DeepSeek 评测。
十、三个诚实边界
- 基准≠现实。 57.4% 的进度分类准确率意味着它还会认错约一半的情况,距离"永远不犯错"很远。
- 依赖底层 VLA。 ER 2 再聪明,也得有靠谱的"手"配合;手脚拉胯,大脑再强也白搭。
- 数据与隐私。 机器人看的是真实物理世界的连续视频,工厂、家庭场景的数据如何合规,仍是未解难题。
十一、行业拐点:机器人的"大脑皮层"竞赛开始了
ER 2 的发布,标志具身智能的竞争从"谁的世界模型更准"延伸到"谁的运行时大脑更会自我监控"。Google 用云端推理 + 端侧 On-Device 的双线卡位,直接对标智元、小米、腾讯的国产具身智能体系。2026 下半年,机器人 AI 大脑的"元认知"能力,很可能成为大厂新的军备竞赛点。
相关阅读:智元机器人、阶跃星辰、ChatGPT、Claude
常见问题(FAQ)
Q1:Gemini Robotics ER 2 和普通 Gemini 有什么区别? ER 2 是专门面向机器人的"具身推理"版本,输入是连续视频流、输出是任务规划与调度指令,而非聊天文本。它运行在 Gemini 家族之上,但为机器人场景做了专门的推理与延迟优化。
Q2:个人开发者能用到吗? 可以。通过 Gemini API 和 Google AI Studio 即可调用 ER 2;企业级私有部署走 Gemini Enterprise Agent Platform 的私密预览。
Q3:它和国内世界模型(如小米 U0、智元 GE-2)谁更强? 定位不同。ER 2 强在"实时自纠错与调度",国产世界模型强在"物理世界预判"。目前只有 ER 2 公开了自纠错基准(57.4% / 91.3%),国产模型多为规划层能力,尚无可比基准。
Q4:机器人会因此"失控"吗? DeepMind 强调 ER 2 满足真实机器人安全所需的亚秒延迟与可控性,且调度权在底层 VLA 与人类监管之下。它仍受限于预设任务边界,不是自主 Agent。