在刚刚落幕的全球人工智能大会上,一场关于人形机器人的技术革新引发广泛关注。超过200家企业携300余台实体机器人参展,从三米高的载人变形机甲到能用镊子夹起2毫米电阻的精密机械臂,各类展品展现了机器人技术的突破性进展。但行业焦点已从单纯的机械结构创新转向更核心的挑战——如何让机器人真正理解环境并自主决策。
传统机器人演示常呈现"回合制"特征:先精准定位,再稳定抓取,每个动作独立完成。这种模式在环境稍有变化时就会失效,比如目标物体偏移或需要边移动边操作。Google DeepMind最新推出的Gemini Robotics 2系统试图打破这种局限,通过"全身智能"模型实现运动与操作的协同控制。在官方演示中,Apptronik Apollo 2机器人能自主走向地面水壶并弯腰拾取,货架取物时还会自然调整步态与重心平衡。
这套系统包含三个核心模型:环境理解与任务规划的ER 2、视觉语言到动作转换的VLA模型,以及轻量化部署的On-Device 2。其创新在于将双腿、躯干、双臂和手指视为耦合动作空间,而非独立模块。测试数据显示,机器人从桌面、地面和货架取物的成功率分别为68.4%、45.7%和76.3%,地面操作成功率较低反映出全身控制的复杂性。
在精细操作领域,机器人面临"最后几厘米"的终极考验。演示中配备22自由度五指手的Apollo 2尝试拧灯泡、封自封袋等任务,两指夹爪在通用抓放成功率达74.2%,但多指灵巧操作差距显著:拧上灯泡成功率仅36%,扎垃圾袋为44%。这表明虽然模型能处理复杂手部动作,但距离人类水平仍有差距。
协作能力展示出新的可能性。视频中Apollo与Franka Duo机器人共同整理工具箱,通过高层推理分配任务而非中央控制。ER 2模型可持续监控进度并处理失败情况,但当前演示仅限于几分钟的预设场景,真实工厂环境中的长期稳定性仍需验证。这种分布式协作模式与Figure Helix 02的分层系统、智元GO-2的异步双系统形成技术呼应。
行业正在形成新的技术路线:保留"大小脑"分层架构,但在动作层实现端到端控制。ER 2作为高层大脑负责规划,VLA模型统一处理全身动作,传统安全机制仍保障底层控制。这种设计平衡了推理效率与响应速度,避免将所有功能塞入单一巨型网络的训练成本与安全风险。On-Device 2模型用不足200个样本适配新硬件的特性,显示出通用模型的发展潜力。
当前技术竞赛聚焦三大方向:多本体兼容、长任务处理和少量数据适配。英伟达GR00T N1.6通过数千小时遥操作数据训练基础能力,Physical Intelligence的π0.5让轮式机器人在陌生住宅完成15分钟连续任务,蚂蚁灵波的LingBot-VLA 2.0则覆盖20种机器人构型。但真实场景中的磨损、碰撞、人类干扰等问题,仍是实验室环境难以模拟的挑战。
Gemini Robotics 2的突破在于将行走、平衡、操作和协作纳入统一评估体系,这标志着具身智能从单一任务向复杂场景的跨越。当WAIC展出的先进机械结构遇上能整体调度身体的AI模型,机器人技术正迈向更接近人类认知的新阶段。不过要真正进入家庭场景,机器人还需解决更多非技术层面的现实问题。









