机器人学会了独立行走,但一直没学会和同伴并肩作战。7月30日,Google DeepMind正式发布Gemini Robotics ER 2,首次为机器人解锁了多机协同能力。不同形态、不同功能的机器人,终于可以像一支队伍一样共享信息、分工协作。

“高级大脑”:让机器人边干活边思考

Gemini Robotics ER 2被定位为机器人的“高级大脑”。它不直接控制电机,而是负责理解物理世界、规划多步骤任务,然后把执行指令交给底层的视觉-语言-动作模型。

与上一代ER 1.6相比,ER 2的最大突破在于连续视频理解能力。机器人可以通过摄像头持续观察自己的动作进度,实时判断任务完成了多少、哪里出了错,并在出错时只重试错误步骤,而不是从头再来。

测试数据显示,ER 2在任务进度分类测试中准确率达57.4%,在关键时刻定位测试中准确率达91.3%,平均时间误差仅0.96秒。这些数字意味着机器人能精准判断“什么时候该停止倒咖啡”这类关键时间节点。

更重要的是,ER 2不再需要“停下来想一想”再动。通过与Gemini Live API的双向流式集成,机器人在执行当前动作的同时,可以同步推理下一步该做什么。波士顿动力的Spot机器人已经用上了这套能力。据谷歌介绍,ER 2以更低计算成本达到接近更大模型类别的精度,执行速度为此前模型的4倍。

首次解锁多机协同:让机器人学会“并肩作战”

多机器人协作是ER 2最引人注目的新能力。

过去,每个机器人都是一个孤岛——各自执行预设任务,互不沟通、互不配合。ER 2第一次让不同形态的机器人通过共享语义理解进行沟通和任务交接。一个机器人知道另一个机器人在干什么、需要什么、什么时候该接手。

官方演示中,Apptronik公司的Apollo 2人形机器人与Franka F3 Duo机械臂平台成功展示了跨设备协同作业。在另一个场景里,Apollo 2指挥谷歌的双臂机器人把工具放进箱子,同时清理车库。

这种协作能力的意义在于:单个机器人完不成的复杂工作流,现在可以由一支“机器人队伍”来共同完成。不同形态的机器人各司其职、相互配合,就像人类团队一样分工协作。

三个模型,各司其职

Gemini Robotics 2是一个模型家族,包含三个成员:

Gemini Robotics 2:视觉-语言-动作模型,将视觉和语言输入转化为电机控制指令,支持对全人形机器人从脚趾到指尖的全身控制

Gemini Robotics ER 2:具身推理模型,即本文主角,负责规划多步骤任务和协调多台机器人

Gemini Robotics On-Device 2:轻量版VLA模型,针对机器人设备本地运行优化,仅需数小时数据即可适配全新机器人形态

这三个模型可以协同工作,也可以独立运行。ER 2负责“想”,Gemini Robotics 2负责“动”,On-Device 2负责在本地设备上快速响应。

已开放可用,安全性能提升

Gemini Robotics ER 2目前已通过Gemini API和Google AI Studio向开发者开放,同时在Gemini企业级Agent平台开启私密预览。谷歌同步发布了模型配置和提示词示例代码。

安全方面,DeepMind称ER 2是其迄今最安全的模型,能够理解安全边界,在人类过于靠近机器人时主动停止动作。

从2025年3月推出基于Gemini 2.0的具身智能模型体系,到ER 1.5、ER 1.6,再到今天的ER 2,Google正在以肉眼可见的速度推进机器人AI的迭代。当机器人不仅能自己干活,还能和同伴协同作战,“物理AGI”的愿景正在从理论走向现实。