机器人竞技场上,一场前所未有的变革正在上演。从刷新人类百米纪录到“原地起飞”近三米,从“害羞跑”姿势火遍海外到赛博张三丰腾空外摆540°,这些曾经只存在于科幻电影中的场景,如今正被机器人一一实现。今年的世界人形机器人运动会更是热闹非凡,来自六大洲16个国家的666支队伍,携2056台机器人齐聚北京,比赛项目也从传统的田径、武术扩展至家庭、酒店、工业和应急救援等真实场景。
然而,当机器人从竞技场迈向真实生活,挑战也随之而来。在赛场上,机器人的“翻车”或许能博人一笑,但在家庭环境中,打翻水杯、撞倒家具或扯乱衣物等失误,却可能带来不小的麻烦。真实世界没有固定的跑道和统一的道具摆放,任何细微的变化都可能导致机器人训练好的动作失效。如何让机器人在动手前先预演,避免这些失误,成为当前科技界亟待解决的问题。
世界模型,这一旨在还原符合物理规律环境的技术,正试图为机器人提供这样的预演能力。它通过理解当前画面和一组准备执行的动作,预测接下来可能发生的情况。然而,不少现有的世界模型在实现可靠的“虚拟测试”方面仍面临挑战。它们可能看懂了画面,却未能真正听从动作指令,推演时间一长,物体和位置便开始漂移,导致虚拟世界里表现优异的策略在真机上未必奏效。
就在机器人开始从竞技场走向真实场景之际,自变量机器人公司发布了自回归世界模型WALL-SS,为这一难题提供了新的解法。WALL-SS构建的“虚拟训练场”突破了传统世界模型的瓶颈,确保动作能真正改变结果,长任务中保持连贯,且虚拟成绩能经得起真机检验。它能够推演持续60秒的倒水和物品整理任务,测试不同动作的结果,如抓水杯的方式是否会导致抓空、碰倒或成功抓起。
研究团队将多套机器人策略分别放入WALL-SS和真实世界进行测试,发现虚拟世界里执行效果良好的动作策略,在物理世界中往往也能取得好结果。这意味着,机器人做的“梦”开始能够用于练习和筛选真实动作,为机器人技术的实际应用奠定了坚实基础。
世界模型作为具身智能领域最受关注的方向之一,可以理解为机器人脑中的预演系统。它根据当前画面和一组准备执行的动作,预测接下来会发生什么,帮助机器人比较多个未来,选择最佳动作路径。然而,许多世界模型在训练时过于依赖成功示范,导致模型在预测时容易走捷径,忽略实际动作与结果之间的复杂关系。
这种偏差在跑步、跳舞等大动作中或许不明显,但在精细操作中却会直接决定成败。夹爪与杯把相差几毫米,机器人就可能抓空;插头角度偏一点,就难以顺利插入接口。机器人从“会做”到“做成”,往往就卡在这最后几毫米。世界模型如果直接抹平这几毫米,给出的未来越流畅,机器人越容易高估动作的可靠性。
世界模型在生成画面时还会面临误差累积的问题。前面一点小误差,会在后续不断累积,导致物体偏离原位,夹爪与杯子的接触关系发生变化。为了解决这些问题,WALL-SS采用了独特的预测方法。它在预测接下来几秒的画面时,先搭出一版“低清预览”,确定大方向后再逐层调清画面,补上物体轮廓、夹爪开合和接触位置等细节。
这种从大轮廓到小细节的层级预测方法,确保了动作和画面在同一条时间线上相互对应。哪只夹爪在什么时候移动到哪里,头部相机和腕部相机应该看到什么变化,都要相互匹配。同一张初始画面配上不同动作后,模型会生成不同未来,确保动作变化能够真正影响结果。
为了验证WALL-SS的有效性,研究团队进行了一系列测试。在衡量模型对动作变化敏感程度的指标上,WALL-SS得到了0.290的高分,远超其他模型。在轨迹精度方面,WALL-SS也获得了0.539的最高分,表明其生成的画面中的机械臂更能沿着指令指定的路线移动。
然而,家庭任务往往包含多个连续步骤,机器人需要记住抽屉是否已经打开、物品目前在桌面还是手里等信息。为了解决这一问题,WALL-SS采用了“尺度压缩的长时间跨度记忆”方法。它让记忆随着时间自动变得“模糊”,刚刚发生的动作保留更多细节,更早的历史则被压缩。这样,模型不需要记住过去的每个像素,只要了解哪些变化还会影响下一步即可。
尽管如此,预测画面的过程中仍不可避免地会积累小误差。为了让机器人学会自己纠正误差,WALL-SS采用了“逐尺度梦境强迫”的训练方法。研究团队给历史信息加入扰动,要求基于有误差的信息预测正确的未来。这样,机器人平时就在“有小错误的梦”里继续往下走,学会别把一个小错滚成整段任务崩溃。
在长时测试中,WALL-SS连续推演了60秒的任务,轨迹误差、片段衔接、物体状态和视觉质量都比对照模型更稳定。其中倒水任务包含接近水瓶、抓握、抬起、倾倒和放回等阶段,机械臂逐帧轨迹误差保持在画面对角线的0.5%以下。这表明,在持续1分钟的操作里,机器人仍能记得自己做过什么,能够稳定地推演未来。
然而,即使动作对了、记忆也没断片,虚拟世界仍然可能和现实存在偏差。为了解决这一问题,WALL-SS给自己的预测安排了两位长期在线的“裁判”。一个裁判检查动作,确保画面里的机械臂按照给定方向移动、物体产生对应变化;另一个裁判负责审核长期一致性,看机器人和物体的状态有没有漂移、前后片段能否接上、多个摄像头看到的世界是否一致。最后,模型根据评分调整下一次生成不同未来的概率,实现“视觉动力学的在线策略对齐”。
经过对齐后,WALL-SS的动作跟随和轨迹精度都得到了显著提升,跨片段边界误差也有所降低。研究团队选取了5个不同训练阶段的策略,在6项任务、20组匹配初始状态下分别进入WALL-SS和真实机器人执行,共得到600对闭环结果。其中,有527对的最终成败一致,WALL-SS在虚拟世界里选出的较好版本有89%的优劣关系与真机测试相同。
WALL-SS还在同一套系统中加入了动作专家。外部动作给定时,视觉生成器负责预测结果;需要模型自主行动时,动作专家则根据当前状态生成下一段控制指令。两个部分共享已经确认的世界状态和动作接口,形成“提出动作—预演结果—继续行动”的闭环。在论文的桌面双臂任务中,WALL-SS的平均任务进度得分远超其他模型。
随着机器人从舞台演示走向真实服务,行业判断技术的方式也在发生改变。一个成功的Demo只是一张入场券,机器人能否重复完成任务、换个环境是否还能工作、模型每次更新要花多少真机成本等问题都变得更为重要。下一轮具身智能竞争将看谁能让机器人学得更便宜、测得更可靠,并走进更多陌生环境。
WALL-SS为我们提供了一种具体的解法:动作必须真正改变预测结果,长任务中不能轻易失忆,虚拟策略排名还要接受真机验证。当世界模型能预测真机策略的相对优劣时,它就开始从内容生成能力变成研发系统的一部分。这有望改变世界模型在机器人公司里的位置,让虚拟环境批量筛选策略成为可能,减少真机测试的成本和风险。
此前,自变量在一次物流分拣直播中展示了搭载WALL-B的双臂机器人的实力。它使用标准夹爪处理了纸箱、软袋、圆柱形快件和泡沫封装生鲜件等随机包裹,完成了1911件有效分拣,准确率超过98%。未来,WALL-SS将让机器人在走向工位之前准备更充分,先在虚拟世界里检查它会不会抓空、碰撞或在连续作业中逐渐跑偏。对于按吞吐量和停机时间计算成本的仓库来说,这类虚拟筛选有机会减少设备占用和现场复位的工作量。











