在世界机器人大会(WRC)的现场,一场关于具身智能未来走向的讨论引发了广泛关注。银河通用创始人兼CTO王鹤在分论坛上抛出一个关键问题:如何定义具身智能的“ChatGPT时刻”?他的答案直指核心:机器人需具备零样本泛化能力,即面对未专门学习过的常见技能时,仍能通过少量互动完成新动作;普通用户无需算法背景即可完成技能教学。这一设想,正通过银河通用最新发布的小人形机器人Galbot ET1(“银河星仔”)逐步成为现实。
“银河星仔”的突破性在于其搭载的AstraBrain-Agent系统。这一自研的具身大模型使机器人能够实时观察环境、理解人类指令并动态规划行为。例如,在演示中,机器人无需预先学习动作视频,仅通过与人类舞者的互动,便完成了街舞中的高难度动作,包括撑地和倒立等需要精准平衡控制的环节。这种能力源于银河通用构建的“全脑架构”:大脑负责环境理解与行动规划,小脑(AstraBrain-WBC)控制身体协调,脑桥则将高层意图转化为具体动作。其中,大脑采用的世界—动作模型(WAM)架构,将视觉、语言与动作生成能力统一,使机器人能预测动作的物理结果并调整行为策略。
技术落地的关键在于数据积累与模型泛化能力。银河通用通过超过10万小时的人类动作数据训练模型,涵盖高精度动作捕捉与互联网视频转换数据。这使得机器人无需预先编写动作轨迹,即可通过少量互动学习新技能。例如,在网球对抗场景中,搭载LATENT高动态规控框架的“银河星仔”能实时预测来球轨迹、调整站位并精准击球,展现了极强的环境适应性与反应速度。更值得关注的是,同一套基模可驱动不同本体执行多样化任务:从商超取货、叠衣服到工业搬箱,模型能力摆脱了硬件与场景的限制,实现了跨本体、跨场景的通用性迁移。
在WRC展位上,“银河星脑”接受了多项真实场景的考验。在早餐任务中,机器人需连续完成取面包、倒水、摆盘等步骤,即使面对杯子被移走或物体被遮挡等突发状况,仍能重新规划并完成任务。叠衣服任务则进一步验证了模型对柔性物体的处理能力——布料形态的持续变化要求机器人每一步操作后更新判断,寻找新的抓取点。这些场景的挑战在于长程任务的误差累积:动作持续时间越长,前期误差对后续步骤的影响越显著。银河通用的解决方案是通过动态环境理解与任务记忆保持,使机器人能在执行中持续修正行为。
产业应用是检验技术成熟度的试金石。银河通用已将产品规模化部署于智慧药房与即时零售场景:机器人需在上万种商品中精准抓取目标,日均重复大量任务,准确率与稳定性直接影响业务运营。在工业领域,Galbot S1双臂机器人最大负载达50公斤,可承担重型物料搬运,同时需判断周围人员位置以确保协作安全。不同场景的机器人形态各异,但共享同一技术底座的“银河星脑”,通过处理柔软衣物、密集货架与工业重物等多样化任务,验证了其泛化能力的商业价值。更关键的是,真实场景产生的数据(如包装材质变化、设备长期偏差)会持续反哺模型训练,形成“部署规模扩大—模型能力提升—新任务适配成本降低”的正向循环。
开放生态是推动具身大模型普及的关键。银河通用宣布向科技企业与产业伙伴开放仿真平台、数据采集设备、基模及强化学习管线,允许开发者围绕“银河星仔”创造新应用。这一策略旨在通过扩大参与者规模,加速模型接触真实问题的频率,从而提升进化速度。例如,其提出的WAM-TTT测试时训练方案,允许用户佩戴第一视角相机拍摄工作过程,模型即可利用无标签视频完成部署,无需重新采集机器人动作数据,大幅降低了技能教学成本。
行业分水岭正在形成。过去,人形机器人的竞争聚焦于身体性能(如运动速度、负载能力),但当机器人进入药房、商超与工厂等真实场景,理解模糊指令、处理未知物体与应对环境变化的能力成为核心需求。身体决定机器人的活动范围,而大脑(具身大模型)则定义其能力边界。与可通过供应链快速提升的本体性能相比,通用大脑的成长需要更长的周期:它需在大量任务中学习物理规律,并在真实场景中接受检验。这种经验积累形成的“know-how”,难以被后来者通过硬件复制快速追赶。
数据基础设施是具身大模型竞争的核心。银河通用构建的五层数据金字塔涵盖互联网语义数据、人类动作数据、仿真平台样本与真机遥操作数据,并通过实际场景反馈持续优化。截至目前,其已积累100万小时人类数据与8万小时真实场景回流数据。当更多机器人进入真实世界,物理经验的丰富度将进一步提升,而模型能力的增强又会降低新机器人与任务的适配成本,形成“数据飞轮”效应。这种部署规模与模型能力的相互推动,正在重塑具身智能行业的竞争格局。











