厨房里,一台机器人正尝试将叉子放入筷子筒。第一次,叉尖卡在筒沿;第二次,它没有重复动作,而是将叉子轻轻靠在筒边,借力调整角度后成功放入。随后,机器人注意到旁边的水渍,主动停下手中动作,擦拭干净后才继续整理。这一系列动作,让围观的研发人员兴奋不已——机器人没有依赖预设程序,而是根据现场情况自主调整策略,展现出初步的泛化能力。
这个场景,是某科技团队在机器人动作模型研发中的一次突破。过去三年,这支由20人组成的团队经历了从虚拟世界到物理世界的转型。最初,他们专注于开发世界模型,试图构建一个能自我演进的虚拟环境,让AI在其中探索与学习。团队负责人回忆,早期他们曾让用户走进梵高的《星月夜》,沿着画作中的笔触延伸出3D场景,这种尝试虽然炫目,却始终与现实需求存在距离。
转折点出现在2025年上半年。团队开始尝试将游戏世界模型的数据替换为第一视角视频——普通人拿着手机在街道、房间中走动的画面。出乎意料的是,模型在脱离虚拟环境后,仍能维持空间关系,生成符合物理规律的交互场景。这一发现与当时兴起的机器人动作模型研究不谋而合,团队意识到,他们积累的技术框架,或许能直接应用于现实世界的机器人控制。
转型并非一帆风顺。团队成员几乎全是模型背景,对硬件领域十分陌生。但现实世界的反馈比虚拟世界更直接——昨天抓不住的杯子,今天抓住了,这种进步让所有人着迷。成员们开始主动学习机械知识,调试硬件参数,甚至搬运机器人设备。有人调侃,那段时间实验室里“模型训练声”与“机器人运转声”此起彼伏,成为独特的研发节奏。
2026年,团队正式更名为“黎曼动力”,名称取自数学家黎曼,寓意在复杂空间中构建机器人的思考与决策能力。同年,他们的世界动作模型Riemann-1.0在WAIC展会上亮相,以62.6%的成绩刷新机器人家务测试纪录,并在积木堆叠、布料折叠等任务中领先行业15个百分点。这一成果背后,是团队对数据规模的极致追求——他们采集了23.2万小时的人类第一视角视频,用纯视觉数据训练模型,打破了行业对“裸手视频价值低”的共识。
在落地场景选择上,团队再次展现出反共识思维。面对工厂自动化市场的诱惑,他们将目光投向家庭场景。负责人认为,标准化环境难以拓展机器人智能边界,只有充满不确定性的家庭场景,才能倒逼模型进化。目前,团队已与日本养老院、酒店合作,通过部署机器人收集真实数据,形成“数据-模型-场景”的闭环优化。
从虚拟到现实,从游戏到家务,这支团队的每一次转向都伴随着争议。有人质疑他们放弃成熟的虚拟世界开发,选择一条未经验证的道路;也有人认为,家庭场景商业化周期过长,可能错失市场机会。但团队始终坚信,真正的技术突破需要跳出舒适区。正如他们让机器人学会“借力放叉子”一样,创新往往诞生于对既有路径的偏离。
如今,黎曼动力的模型已能处理85%的家务任务,但团队清楚,这仅是开始。他们正在训练模型理解更复杂的指令,比如“把水果从冰箱拿到客厅,但别碰倒花瓶”。这种对细节的执着,源于一个更宏大的目标——让机器人真正融入人类生活,而不仅仅是完成预设动作。正如团队成员所说:“我们不想造一台会做家务的机器,而是想创造一个能理解人类需求的伙伴。”











