7 月 30 日,Google DeepMind 宣布推出其人工智能模型 Gemini 的新版本 Robotics 2。该模型系列能够控制人形机器人在内的多种机器人,使其自主适应不可预测的环境,能够对每一个动作进行推理,从而解锁广泛的任务范围,包括清理垃圾和捡起洒水壶等。
据称,此次的更新加入了“智能全身控制、高级灵巧操作和多机器人协作”,宣告机器人发展迈入全新阶段:为下一代真正可适应的机器人提供动力的智能层。之前的初代 Gemini Robotics 系统已经能够驱动机器人执行精细操作,如封口储物袋和折叠折纸,但这些都是通过机械臂和机械手完成的。
这种强大的智能还可以在设备本地运行,同时能在几小时内无缝适应全新的机器人本体,让机器人将学到的技能快速转移至不同的机器人机体上。该系统甚至可以让不同机器人们联手工作,更快地完成任务。
如今,让 AI 真正走入物理世界正成为科技巨头在通往通用人工智能(AGI)道路上的角力关键。Google DeepMind 在发表的一份声明中表示,“这是我们在迈向所谓的物理 AGI(即让机器人能够完成人类能做的任何事情)道路上的又一个里程碑。未来的机器人将能与人类并肩工作,解决复杂挑战。”
实现“智能全身控制”,演示效果惊艳
谷歌发布了搭载 Gemini Robotics 2 平台的机器人执行各种操作的演示视频,效果相当令人印象深刻。
首先是将物理 AI 的应用范围从桌面任务扩展到人形机器人,实现了对人体的智能全身控制。例如,当 Apptronik 的 Apollo 2 人形机器人接收到“把浇水壶放到底层架子的绿色箱子里”的指令时,它能自主走到桌子拿起水壶,再走到架子旁精准放置。
其次,要在家庭和工作场所真正发挥作用,机器人需要具备精细操作能力。演示视频中,机器人把书籍放到书架、收拾棋盘、将磁带放入手提式录音机、整理桌面等。
据悉,Gemini Robotics 2 还为不同的硬件平台赋予了高度灵巧性,能控制五指手完成打结或拧灯泡等动作,透过装载于 Apollo 2 上的 22 自由度五指 SharpaWave 手,还能执行打结、密封夹 链袋等极度精细的动作。同时,它也能管理标准两指平行夹爪(如 Franka Duo 平台)完成紧密包装等复杂任务。
谷歌内部评估报告称,在三种全身操控类别中,成功率介于 45.7% 至 76.3% 之间;在三种 Franka Duo 抓取器类别中,成功率介于 74.2% 至 89.6% 之间,而多指任务的成功率则介于 32% 至 92% 之间。
同时,谷歌承诺,上述演示视频展示的是“完全自主”机器人的“实时录像”。这与 Elon Musk 旗下(埃隆·马斯克)的 Optimus 机器人形成鲜明对比,后者一次高调的演示曾被外媒报道使用了远程操作员来控制机器人。
值得注意的是,这些机器人并非通用型设备,不能胜任各种任务。该模型是经过专门训练来执行视频中的每一项任务的,训练方式结合了人工远程操作、视频示例和模拟。
三大核心模型,建构机器人超级大脑
目前大多数机器人都是预先编程或远程操控的,只能执行狭窄、重复的任务序列。它们缺乏真正的自主学习和适应不可预测环境的能力。将学到的技能从一个机器人本体迁移到另一个本体仍然极其困难。
Google DeepMind 提出,为了大规模应对最具挑战性的问题,各种形状和尺寸的机器人都需要 AI 模型赋予它们智能思考、行动和交互的能力,以安全地完成任务。
而他们这次成果的做法正是为机器人搭载多个不同的 AI 模型,使其对周围环境具备多模态理解能力。其中包含一个视觉语言模型用于理解,以及两个视觉语言动作模型分别控制全身和手部动作。
根据 DeepMind 团队负责人 Carolina Parada 带领发布的公告指出,Gemini Robotics 2 包含三个具备高度能力的模型,各自肩负不同任务。
其中,Gemini Robotics 2 作为最先进的视觉-语言-动作(VLA)模型,能将视觉与语言输入转换为马达控制,实现从脚到指尖的完整人形机器人控制,并大幅提升双手与夹爪的灵巧操作能力。在实际能力方面,Gemini Robotics 2 首次实现了将意图转化为人形机器人的智能全身动作。
Gemini Robotics ER 2 是一款“具身推理(Embodied Reasoning)”视觉语言模型,扮演着机器人的大脑 Agent 角色,能与人类沟通、理解物理世界,并规划长达数分钟的多步骤任务,甚至新增了机器人团队协作功能。也就是说,不同类型的机器人能够相互通信并协同工作,以解决单个机器人无法独自完成的复杂工作流。
在代理式推理能力上,ER 2 模型能处理涉及数百个决策的复杂任务,并具备自我修正机制;它还支持多机器人协作,让不同类型的机器人共同完成单机无法负荷的工作流。
许多机器人应用需要在没有网络延迟或互联网连接的情况下运行,Gemini Robotics On-Device 2 正是为应对这些限制而构建的,这是一款专为设备本地端运行的 VLA 模型,主打极高的适应效率。
据介绍,该模型原生支持多本体,并继承了 Gemini Robotics 1.5 中的先进“运动迁移”技术,现在只需数小时的适应时间(通常少于 200 个示例)就能适应新的双臂机器人本体。即使面对形状、传感器和自由度截然不同的新本体,该方法同样有效。
目前,Gemini Robotics ER 2 已在 Google AI Studio 提供,并在 Gemini Enterprise Agent Platform 展开私人预览;而 VLA 与本地端模型则仅对早期合作伙伴开放。
增强具身推理,做最安全的机器人模型
“安全问题更加紧迫,因为你要让它们面对大量不同的场景,会出现很多不确定性,所以希望能够更深入地理解安全问题。”Parada 称。Google DeepMind 表示,正采取多层次方法,将传统物理安全措施与强大的 AI 安全框架相结合,来确保未来机器人的安全性。
据悉,Gemini Robotics 2 特别推进了机器人在应对现实世界不确定性以及与人类协作方面的安全性。他们推出了 ASIMOV-Agentic,这是一个用于代理式安全编排和不确定性解决的新基准。例如,它衡量具身推理智能体拒绝 VLA 发出的不安全工具调用请求的能力,也衡量智能体预测任务是否可能完成以及在不明确时主动请求人工干预的能力。
通过增强的具身推理,Gemini Robotics ER 2 在安全约束遵循和人类接近度基准上是其迄今为止最安全的机器人模型,能更好地检测人类何时靠近,触发安全工具调用,这也是协作安全标准中的关键要求。当有人靠近时,Gemini Robotics ER 2 能够成功停止人形机器人,并在区域无人后自主恢复工作。
另值得一提的是,谷歌这次做的的是软件层面,不是机器人本体。近期,美国刚刚以安全为由禁止未来销售中国制造的机器人。而这款软件可能运行的许多机器本体,恰恰是在中国制造的。













