在具身智能领域,一场关于技术路线的争论正愈演愈烈。当前行业焦点并非集中在某个模型的具体性能上,而是围绕机器人发展的核心路径展开——究竟该选择视觉语言动作模型(VLA)路线,还是视频生成动作模型(WAM)路线?这两种看似对立的技术方案,实则都源于数字世界大模型的延伸:VLA通过扩展视觉语言模型实现动作控制,WAM则尝试将视频生成技术迁移至机器人领域。
蚂蚁集团旗下具身智能公司灵波选择了一条与众不同的道路。这家成立不久的企业既未跟随VLA路线,也未采用WAM方案,而是开创性地提出"具身原生"理念——从底层架构开始,完全基于物理世界数据训练专属基模。公司CEO朱兴在2026外滩大会上明确表示:"具身智能不是数字智能的简单延伸,必须建立在真实物理数据基础之上。"
技术团队通过实践验证了传统路线的局限性。灵波1.0系列曾尝试微调通用视频生成模型Wan来适配机器人,但最终因数字模型存在性能天花板、微调导致知识退化等问题而失败。首席科学家沈宇军比喻道:"这就像要求男性生育,完全违背了基本规律。"当GPT-6等数字大模型持续进化时,基于这些模型开发的具身应用可能面临价值归零的风险,这种担忧在行业内引发广泛共鸣。
灵波的解决方案体现在其全栈大脑2.0系统中。该系统包含六个创新模型,其中LingBot-VA 2.0作为业界首个具身原生动作模型,采用自回归架构从头训练,整合了语义视觉动作分词器、严格因果预训练等四项核心技术,在单块GPU上实现了150Hz的实时推理效率。配套的LingBot-VLA 2.0则通过预训练6万小时真实物理数据,覆盖17家厂商的20种机器人构型,将推理延迟压缩至130毫秒以内。
数据战略构成灵波的核心竞争力。区别于行业普遍采购成品数据的做法,公司建立了定制化数据采集体系:由模型研发团队定义数据需求,通过小规模试采沉淀标准操作流程(SOP),再由供应商批量采集。这种流式交付模式使数据可用率从15%提升至90%以上。首席数据科学家黄用韬强调:"数据质量比数量更重要,分布特征才是模型训练的关键配方。"
在应用场景选择上,灵波展现出独特的战略眼光。公司重点布局国大药房智慧机器人和工业上下料两个领域,其中药房场景被视为机器人进入家庭的前哨站。在上海国大药房东靖路门店的试点中,机器人可在不改造货架条件下完成药品识别、抓取和配送,单次取药平均耗时不足3分钟,覆盖150余种常用药品。这种"人机协作"模式既保障了用药安全,又有效分担了药师夜间工作负荷。
朱兴对商业化节奏保持审慎乐观。他提出三个落地约束条件:封闭环境、短程任务和成本可控,预计今明两年将在特定场景实现规模化应用。但公司明确划定战略边界——专注机器人大脑开发,输出闭源基模与工具链,不涉足本体制造。这种定位已产生积极反馈:乐聚等本体厂商基于LingBot-VLA 2.0开发的模型实现开源共享,形成数据回流的正向循环。
行业格局正在发生深刻变化。资本市场上,Skild AI、Physical Intelligence等独立大脑厂商获得高额融资;本体企业方面,宇树科技将48%的募投资金用于模型研发,凸显大脑技术的重要性。朱兴预测,具身智能领域将经历"百模大战"后逐步收敛,最终形成几家主导企业的竞争格局。对于当前融资,他解释主要用于人才激励和公司治理优化,为长期发展奠定基础。
灵波选择的原生路线面临严峻考验。其核心命题在于:能否完全通过物理真实数据,培育出独立于数字世界的机器人智能。这个问题的答案,将随着技术迭代和场景落地逐步显现。在具身智能从实验室走向产业化的关键阶段,灵波的探索为行业提供了新的思考维度和实践样本。











