谷歌DeepMind近日宣布推出一系列面向机器人领域的人工智能模型,其中最引人注目的是能够实现全身动作协调的人形机器人系统Gemini Robotics 2。这一突破标志着谷歌将Gemini旗舰AI模型的技术能力延伸至物理世界,为机器人赋予更接近人类的运动与决策能力。
在官方演示中,搭载Gemini Robotics 2的Apptronik公司人形机器人Apollo展现了令人惊叹的自主能力。该机器人不仅能完成行走、下蹲等基础动作,还能根据自然语言指令执行复杂任务——例如穿越房间、避开障碍物、拿起洒水壶并精准放置在指定架子上。这一成果得益于新模型对全身关节的协同控制,突破了传统机器人仅能控制上半身的局限。
此次发布的系统包含两个核心组件:Gemini Robotics 2负责将视觉输入与语言指令转化为电机控制信号,而Gemini Robotics ER 2则承担"推理大脑"的角色。后者能规划多步骤任务流程,甚至协调多个机器人完成协作目标。测试数据显示,新系统在"拧灯泡"等精细操作中成功率达92%,但在扎垃圾袋等更复杂任务中仍需提升。
安全性能成为本次升级的另一重点。谷歌推出的新评测基准专门测试机器人在不确定情况下的风险判断能力,例如识别潜在危险指令并主动拒绝执行。据称,Gemini Robotics ER 2在遵循人类避让指令和风险规避方面表现尤为突出,被公司称为"迄今最安全的机器人模型"。
在技术开放策略上,谷歌采取差异化路线:Gemini Robotics ER 2将通过AI Studio开发者平台提供企业级预览,而更专业的Gemini Robotics 2和On-Device 2模型则优先向早期合作伙伴及100余家认证测试机构开放。目前,Apptronik、Agile Robots SE和波士顿动力等企业已加入合作阵营,开发者申请通道也同步开启。
项目负责人坦言,要实现真正的人类级灵巧性仍面临挑战。当前机器人动作仍显迟缓谨慎,原因在于需要花费时间处理本应凭直觉完成的决策。更关键的是,机器人学习效率远低于人类——人类通常经历一两次错误就能调整行为,而机器达到同等水平仍需漫长训练过程。
此次发布可视为谷歌机器人战略的重大转折。自2023年关闭Everyday Robots部门后,公司通过整合DeepMind技术资源重新布局。值得注意的是,竞争对手OpenAI正研发融合视觉、语言与动作的通用机器人模型,英伟达则通过软件平台助力开发者训练AI机器人,行业竞赛已进入白热化阶段。







