在具身智能领域,一场关于“大脑”的竞赛正悄然展开。当多数企业还在单一场景中摸索时,一家名为自变量的公司已在家庭与物流两大领域同时发力,用同一个“大脑”驱动机器人完成截然不同的任务,引发行业关注。
家庭场景被视为检验机器人通用能力的终极考场。这里没有重复的任务,户型、家具摆放、光照条件千差万别,小物件位置随时变化,任务琐碎且长尾。从取外卖、叠衣服到铲猫砂,机器人需应对各种意外情况。这种极致的复杂性,迫使模型不断拓展能力边界,在动态环境中打磨环境理解、长程执行和常识推理等通用底层能力。
与家庭场景不同,物流场景是半结构化的“练兵场”。作业环境规整、流程相对标准,但工况残酷——包裹源源不断,大小重量各异,对机器人的快、准、稳要求极高。这里每天产生海量高频重复任务,可验证模型的调度效率、运动精度与故障容错能力,以及长时间持续作业的能力。
多数玩家选择专攻一个场景,或遵循传统自动化逻辑,将家庭与物流场景分开处理,模型、数据、硬件各自为战。能真正将产品大规模应用的企业寥寥无几。但自变量却选择同时啃下这两块“硬骨头”,用同一套数据基础设施满足两个场景需求,让“大脑”在家庭中拓展能力边界,在物流中淬炼工业级性能。
自变量的“最强大脑”名为WALL-B,是全球首个基于“世界统一模型”(WUM)架构的具身大模型。与行业主流的VLA路线不同,WALL-B将视觉、语言、触觉、动作和物理预测融入同一个神经网络,让机器人理解重力、惯性和摩擦力,能推演动作带来的状态演化,还具备记忆与持续学习能力,可跨本体、跨任务、跨场景执行。
这一架构源于自变量对行业的独特判断。公司创始人兼CEO王潜认为,具身智能需要一套独立于数字世界基础模型、专门服务物理世界的“基础模型”。他以人脑为参照——负责精细操作的脑区规模与语言、高级思维脑区相当,操作复杂度不亚于语言本身。因此,自变量坚持端到端模型,将各种能力放入同一个“通才”模型中,让模型同时学习动作、视觉、语言和物理规律。
跨本体泛化能力是“大脑”的另一重考验。在WRC展台上,WALL-B同时驱动量子一号和二号人形机器人、机械臂和标准夹爪、灵巧手。插花、拧风扇开关等精细操作交给灵巧手,翻包裹等重复高强度任务则交给机械臂与夹爪。今年5月,明星企业Figure AI的机器人以1248件/小时的速度完成物流分拣直播。而自变量在海外平台发起的挑战中,两台搭载标准夹爪的机械臂连续作业5小时,分拣速度达到1911件/小时,用更简单、便宜的硬件证明了大脑的强大能力。
商业逻辑上,自变量既有长远目标,也注重短期变现。家庭是行业公认的终局场景,但距离大规模商业化尚有距离。今年上半年,自变量机器人开始大规模进入真实家庭工作,为未来深度落地打入锚点。而物流分拣的账今天就能算清楚——每小时分拣量、准确率、替代人工数量、投资回报周期等都是B端客户关注的硬指标。据王潜透露,自变量从数据采集、模型训练到生产部署打通物流产线仅用约三个月,投资回报率已满足企业水平,而海外同类场景投入通常长达两年半。
自变量的核心竞争力不仅来自模型本身,更来自模型架构、数据管线与基础设施(Infra)以及组织管理等层面。以数据为例,多数厂商将数据视为标准化大宗商品,但具身数据更像复杂工业品,需经过定义、采集、判别、处理和反复迭代。自变量坚持使用高质量、包含真实物理交互的数据,并自研完整数据管线,包括采集硬件、数据清洗、训练评测等维度。
2024年,自变量建成首个大规模数采工厂;今年推出Quanxta Zero无本体数采方案,用定位头环加智能双夹爪实现全身移动采集,定位毫米级,多模态时间同步精度约1毫秒。数据上传云端后,自动完成时间戳对齐、清洗、智能标注与人机协同质检,再流入模型训练环节。这一闭环数据飞轮是全球唯一跑通“数据采集—数据处理—模型训练”完整闭环的数采产品,基于该链路,自变量使用10%的遥操作或真机数据配合90%的无本体数据,即可达到100%真机数据基线的训练水平,数据成本降低90%。
在基础设施层面,自变量开源了分布式DMuon优化器。Muon是深度学习领域表现最好的优化器之一,但原有方案通信带宽比经典AdamW高出约50%;自变量通过分布式改进去掉额外开销,同时获得约30%的收敛速度增益。这一贡献不仅限于具身领域,整个语言模型领域也可能受益。自变量还推出跨模态具身动作分词器X-Tokenizer和单样本学习框架HOST,并连续发布三个具身大模型,均达到世界领先水平。手握“最强大脑”和全栈能力的自变量,已在具身智能竞赛中占据有利位置。











