ITBear旗下自媒体矩阵:

GigaBrain-0.7:三系统协同赋能,让机器人操作更智能高效

   时间:2026-09-04 23:33:39 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在机器人技术领域,一个核心难题长期困扰着研究人员:如何让不同形态的机器人学会通用且精准的操作技能?GigaAI团队近期发布的技术报告提出了一种创新解决方案——通过三系统协同架构,让单一模型在16种机器人平台上实现跨形态操作。这项突破性成果正在重新定义机器人大模型的发展路径。

传统VLA(视觉-语言-动作)模型存在明显局限。这类模型通常只能处理当前帧画面,如同仅凭静态照片判断故事走向,难以捕捉动作的时空连续性。更严重的是,分阶段训练方式导致视觉理解与动作生成模块之间存在信息损耗,就像让解说员与操作工强行配合手术,效果可想而知。GigaBrain-0.7通过整合理解、预测、行动三大核心能力,构建起有机协作的智能系统。

系统2作为"认知中枢",承担着任务拆解的重任。基于30亿参数的PaliGemma2视觉语言模型,它能将"整理衣物"等复杂指令转化为"捡起红色帽子"等具体步骤。这种分层规划机制类似于为机器人配备导航系统,确保每个动作都服务于最终目标。实验显示,缺乏这种拆解能力的模型在执行多步骤任务时,成功率会下降60%以上。

系统3的创新性体现在其独特的"未来想象力"。通过50亿参数的世界模型GigaWorld-1,该系统不仅能生成动作执行后的预期画面,更能自主计算任务进度值。当机器人操作盒盖时,系统能通过画面变化自动判断"盖子掉落"等异常状态,无需人工标注。这种基于视觉预测的评估机制,使机器人获得类似人类的自我纠错能力。

动作生成系统1融合了混合Transformer架构与软知识隔离技术。MoT结构允许视觉语言模块与动作专家共享注意力机制,同时保持参数独立。Soft KI技术则通过可控梯度传导,在保留语言理解能力与获得具身控制力之间取得平衡。这种设计使系统既能利用语言模型的丰富知识,又能精准控制机器人关节运动。

短期视觉记忆模块的引入解决了机器人"健忘症"问题。通过时空模块压缩历史信息,系统能记住最近数帧的关键特征。在模拟测试中,配备记忆模块的机器人成功跳出重复动作循环,任务完成效率提升40%。这种机制使机器人获得类似人类的场景记忆能力,能区分同一位置的不同访问阶段。

预训练模型展现出的零样本泛化能力令人印象深刻。在未经过任何微调的情况下,模型能在全新机器人平台上完成70%以上的复杂任务。当面对训练数据中未出现的葡萄抓取任务时,机器人仍能准确识别目标并完成操作。这种能力源于模型对操作逻辑的抽象理解,而非简单的场景匹配。

后训练阶段的数据显示,GigaBrain-0.7在语言跟随任务中的成功率达到91.5%,较前代模型提升15.4个百分点。在Maker H01人形机器人平台上,复杂操作任务的成功率更是提高30.9%。特别在食物加工等需要多阶段规划的任务中,系统3的预测评估能力使任务完成质量显著提升。

经验驱动的强化学习机制构成最后一道优化屏障。离线阶段通过优势加权回归技术,从3000小时的真实操作数据中提炼优质动作片段。在线阶段则引入人工纠正信号,专门针对扎带打结等精细操作进行强化训练。四个测试任务在经历完整训练流程后,成功率均达到100%,验证了该机制的有效性。

标准化测试进一步证明模型的鲁棒性。在RoboTwin 2.0基准测试中,模型在域随机化困难设置下取得67.9%的成绩,领先第二名8.3个百分点。RoboColiseum评测显示,其在空间推理维度上的表现尤为突出,这得益于系统3对三维场景变化的精准预测能力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version