谷歌DeepMind在机器人领域再掀波澜,正式推出新一代机器人智能系统——由三款核心模型组成的Gemini Robotics系列。这一突破性成果标志着机器人控制从单一动作执行向全身协同、多任务规划的范式转变,为具身智能发展注入新动能。
作为运动控制中枢的Gemini Robotics 2,首次实现了对机器人全身的统一调度。该VLA模型通过整合视觉与语言输入,直接生成涵盖腿部行走、躯干平衡、手臂操作及手指精细动作的复合指令。在演示视频中,搭载该系统的Apollo 2人形机器人展现了令人惊叹的全身控制能力:从识别洒水器与收纳箱位置,到完成行走、抓取、弯腰、放置的连贯动作,整个过程无需人工干预。更引人注目的是其多指灵巧操作——机器人能以恰到好处的力度旋下灯泡,用别扭却有效的方式撑开塑料袋,甚至完成密封袋塑封这类需要双手配合的精细任务。
这套系统的通用性同样值得关注。研究人员将其部署在Apptronik人形机器人、22自由度Sharpa灵巧手及双Franka机械臂平台等不同硬件上,均能实现相似操作。这种"一脑多用"的能力,得益于模型对多模态感知数据的深度融合——头部摄像头提供环境全局视图,腕部相机则在操作时捕捉细节,使机器人既能规划路径又能精准执行。
如果说Gemini Robotics 2解决了"如何动"的问题,那么Gemini Robotics ER 2则专注"做什么"的规划。作为系统的高级决策模块,ER 2具备三大核心能力:任务拆解、动态调整与多机协作。面对"整理桌面并收纳物品"这类复杂指令,ER 2能将其分解为识别物品、规划路径、执行抓取等数百个子任务,并在执行过程中持续监测进度。当演示中的机器人因碰撞导致任务中断时,ER 2立即重新规划路径,最终成功完成任务。更令人瞩目的是其多机器人调度能力——不同型号的机器人可共享任务信息,通过分工协作完成单台机器人难以胜任的工作。
针对实际部署中的效率挑战,谷歌推出了端侧模型Gemini Robotics On-Device 2。这个轻量化模型可直接在机器人本地运行,既避免了云端通信延迟,又适应工厂、野外等网络不稳定场景。其最大亮点在于快速适配能力:借助运动迁移技术,仅需不到200个训练样本和数小时微调,就能让模型掌握新双臂机器人的操作特性。在Dexmate、SO101等平台的测试中,即使面对传感器布局、自由度差异显著的硬件,该模型仍能保持高效性能。
目前,Gemini Robotics ER 2已通过Google AI Studio开放访问,并在Gemini Enterprise Agent Platform提供企业级预览服务。这项成果不仅展现了谷歌在机器人领域的深厚积累,更通过模块化设计为行业提供了新思路——将感知、决策、执行功能解耦,既降低系统开发难度,又提升整体灵活性。随着这三款模型的逐步落地,机器人从实验室走向真实场景的步伐或将显著加快。












