ITBear旗下自媒体矩阵:

谷歌Gemini Robotics 2发布:单模型驱动全身自由度,开启机器人通用智能新篇

   时间:2026-08-01 03:23:16 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

谷歌DeepMind近日推出新一代机器人基础模型Gemini Robotics 2,标志着机器人控制技术迈入全新阶段。该模型首次实现视觉-语言-动作(VLA)架构对完整人形机器人的端到端控制,覆盖从双腿行走至手指精细操作的全身自由度,并支持跨硬件平台的模型权重共享,为机器人通用化发展开辟新路径。

传统机器人开发长期面临两大核心挑战:控制系统的碎片化与硬件适配的封闭性。多数人形机器人采用分层架构,行走、平衡与操作策略由独立模块分别控制,导致真实场景中常出现动作衔接卡顿;而针对特定机型训练的策略模型,在更换传感器或执行器时需重新采集数据,严重制约技术规模化应用。Gemini Robotics 2通过统一模型架构,试图同时破解这两道难题。

该模型家族包含三个核心组件:主力VLA模型直接处理摄像头图像与语言指令,输出电机控制信号;具身推理模型ER 2作为“大脑”拆解任务流程并监控执行进度;端侧模型On-Device 2则针对无网络环境优化,可在本地芯片快速部署。测试数据显示,搭载该架构的Apptronik Apollo 2机器人能自主完成“取浇水壶并放置货架”的复合任务,全程无需人工干预步骤分解。

跨硬件兼容性成为最大亮点。同一模型检查点可驱动三种不同配置的机器人:Apollo 2分别搭配SharpaWave五指手与Inspire手,以及双臂平台Franka Duo搭载Robotiq夹爪。这种设计使模型权重与硬件形态解耦,新机型适配仅需200个演示样本与数小时训练,较传统方法效率提升数十倍。项目负责人透露,团队正与多家硬件厂商合作推进技术落地。

尽管实现全身控制闭环,但当前模型仍存在明显局限。实测表明,Apollo 2从桌面取物的成功率为68.4%,地面取物降至45.7%,移动速度也明显慢于人类。在精细操作方面,五指机械手SharpaWave装灯泡成功率仅36%,垃圾袋打结等场景表现更不理想。研究人员承认,复杂动态环境下的鲁棒性仍是待攻克的关键问题。

协作能力开发引发行业关注。ER 2模型支持异构机器人通过语义理解自动分配任务,演示中Apollo 2与Franka Duo联合完成了单机无法实现的复杂流程。这种设计暗含产业生态布局——通过协调不同厂商机器人的优势领域,构建更高效的物理世界任务网络。同步发布的安全基准ASIMOV-Agentic则通过实时空间推理,使机器人能在人类靠近时自动暂停,号称“史上最安全机器人模型”。

与竞争对手相比,Gemini Robotics 2选择差异化技术路线。Figure公司的Helix 02虽在长时序控制完整度上更胜一筹,但其架构高度绑定自有硬件;Physical Intelligence的π0.7模型强调技能重组泛化,却未展示下肢-操作联合控制能力。DeepMind的解决方案通过开放模型权重与推理层接口,试图在通用性与实用性间寻找平衡点。

目前ER 2模型已通过Google AI Studio开放使用,VLA主力模型与端侧版本则采取合作伙伴预览制,首批合作方包括Apptronik、Franka等企业。随着首批部署案例逐步落地,这场关于机器人通用智能的架构之争,或将重新定义人机协作的未来图景。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version