ITBear旗下自媒体矩阵:

昆仑万维新突破:23.2万小时人类视频,让机器人“眼里有活儿”

   时间:2026-07-19 20:52:04 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

机器人领域迎来重大突破,在公认难度极高的家务挑战赛RoboCasa-365中,一款名为Riemann-1.0的模型以62.6%的成绩登顶榜首,将此前最高纪录大幅提升8.4个百分点。值得注意的是,榜单上多数模型的成绩仍徘徊在50%以下,而这个首次亮相的模型已在业界引发广泛关注。

通过公开演示视频可见,该模型操控的机器人展现出惊人的操作能力:不仅能精准夹取平铺在桌面上的勺子,还会主动倒掉碗中残汤后再进行收纳,最后甚至完成桌面清洁。这种类人化的操作逻辑,颠覆了传统机器人机械执行指令的模式。

这款由昆仑万维旗下子公司黎曼动力研发的模型,其核心突破在于采用独特的数据训练范式。在23.2万小时的训练数据中,占比最大的竟是人类日常活动的第一视角视频,涵盖烹饪、整理等41种场景。这种将人类行为数据转化为机器人控制能力的方法,正在重塑行业技术路线。

具身智能领域长期存在VLA(视觉-语言-动作)与世界模型两大技术路线的争论。前者如同"直觉派"强调快速响应,后者则像"深思派"注重逻辑推演。随着英伟达等机构的研究推进,两条路线开始呈现融合趋势,世界动作模型(WAM)正成为新的技术主流。

黎曼动力的创新在于构建了完整的数据处理流水线。针对海量无标注的人类视频,团队开发了自动化处理系统:首先矫正画面畸变,接着用视觉语言模型将长视频切割为细粒度动作单元,再通过3D重建技术将手部运动转化为机器可读的坐标数据。经过多重质量筛选后,这些数据最终形成结构化的"动作教材"。

模型架构采用扩散架构与全因果建模框架,将视觉动态、环境状态和动作序列统一学习。特别设计的动作映射模块,使单一模型能够适配41种不同形态的机器人本体。训练过程分三阶段推进:初期以理解物理规律为主,中期引入机器人数据进行动作校准,后期通过强化学习提升操作精度。

实验数据显示人类视频的独特价值。在RoboCasa-365测试中,仅使用机器人数据训练时成功率为43.4%,加入外骨骼设备数据后提升至48.2%,而引入人类视频后直接跃升至62.6%。在双灵巧手机器人的专项测试中,人类视频预训练使长程任务成功率从42.96%提升至71.11%,对新场景的适应能力也显著增强。

真机测试环节,模型在积木堆叠、布料折叠、杂物整理等四类典型家务场景中,平均成功率达85%,过程完成度高达94.43%。特别是在需要多步骤衔接的厨房收纳任务中,机器人展现出连贯的操作逻辑,每项任务的中间步骤完成率均超过91%。

昆仑万维的跨界布局看似突兀,实则暗合技术演进逻辑。该公司此前在数字内容生成领域已构建完整生态,其世界模型技术既支撑游戏、视频等数字业务,又通过Riemann-1.0项目延伸至物理世界。这种战略布局使集团同时掌握数字孪生与具身智能两大技术底座。

成立独立子公司的决策,反映出对机器人赛道特性的深刻认知。该领域需要长期技术积累和持续资源投入,独立运营模式既能保证团队专注研发,又能借助母公司的算力资源和生态优势。这种组织架构设计,为技术突破与商业落地的平衡提供了新范式。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version