谷歌DeepMind近日推出新一代机器人基础模型系列Gemini Robotics 2,标志着人形机器人控制技术迈入全新阶段。该系列首次实现单一视觉-语言-动作(VLA)模型对完整人形机器人的全身控制,覆盖从双腿到手指的全身自由度,并支持跨不同硬件平台的模型权重共享,为机器人行业突破技术瓶颈提供了新思路。
传统机器人控制存在两大核心难题:一是运动与操作的分层架构导致协调困难,例如行走与抓取由独立系统控制,在复杂场景中易出现动作脱节;二是硬件适配成本高昂,针对特定机型训练的策略难以迁移至其他设备,限制了技术规模化应用。Gemini Robotics 2通过端到端模型设计,将摄像头输入与语言指令直接转化为电机控制信号,首次实现同一模型驱动三种不同机器人本体,包括Apptronik Apollo 2搭配不同机械手、双臂平台Franka Duo等组合。
该系列包含三个核心模型:主力VLA模型负责全身运动控制,具身推理模型ER 2承担任务拆解与进度监控,端侧模型On-Device 2则针对无网络或低延迟场景优化。ER 2通过双向流式接口与VLA实时通信,可在当前动作执行时提前规划下一步,避免传统架构中“思考-停顿”的延迟问题。例如,在演示任务中,Apollo 2机器人根据指令“将浇水壶放入绿色箱子”,自主完成行走、抓取、放置全流程,无需人工干预步骤拆解。
尽管实现技术突破,Gemini Robotics 2仍面临实际挑战。测试数据显示,Apollo 2从桌面拿取物品成功率为68.4%,地面拿取降至45.7%,移动速度也明显慢于人类。在多指灵巧操作方面,五指机械手SharpaWave执行拧灯泡任务成功率达92%,但装回灯泡成功率骤降至36%,垃圾袋打结、密封拉链袋等精细动作表现欠佳。DeepMind承认,全身控制的闭环虽已打通,但距离稳定可靠仍有差距。
跨硬件协作能力成为该系列另一亮点。ER 2支持异构机器人通过共享语义理解分配子任务,无需预设通信协议。演示中,轮式机器人与双臂机器人联合完成搬运任务,分别发挥平地移动与操作优势。为保障安全,DeepMind同步推出ASIMOV-Agentic基准,通过拒绝不安全指令、预测任务可行性等功能,将该系列称为“迄今最安全的机器人模型”。ER 2的空间推理能力也显著提升,可实时检测人类距离并触发安全停止,同时扩展至10类仪表读数识别与连续视频事件判断。
与行业竞品相比,Gemini Robotics 2的差异化优势在于硬件通用性。Figure的Helix 02虽在长时序全身控制完整性上更优,但仅适配自家机器人;Physical Intelligence的π0.7侧重技能重组泛化,尚未展示下肢与操作的联合控制。DeepMind模型则支持单一权重驱动多平台,并开放推理层供开发者定制。目前,ER 2已通过Google AI Studio开放使用,VLA主力模型与端侧模型仅向早期合作伙伴提供,部署伙伴包括Apptronik、Franka等企业。









