在具身智能领域,一场关于技术路线的激烈争论正持续升温。过去一年,行业焦点并非集中在某个模型的具体效果上,而是围绕机器人发展路径展开:究竟是选择视觉语言动作模型(VLA),还是视频生成动作模型(WAM)?这两种看似对立的技术路线,本质上都依托于数字世界的大模型——VLA是视觉语言模型向动作领域的延伸,而WAM则将视频生成模型应用于机器人控制。
在这场路线之争中,蚂蚁集团旗下的具身智能公司灵波选择了一条截然不同的道路——"具身原生"。该公司CEO朱兴与首席科学家沈宇军在多个场合明确表示,具身智能不应是数字智能的简单延伸,而必须基于物理世界的真实数据构建。这一战略判断源于灵波1.0系列的实践教训:该版本曾通过微调通用视频生成模型Wan来适配机器人需求,但最终因数字模型存在性能上限,且微调过程破坏了原模型的先验知识,导致泛化能力显著下降。
沈宇军将这种技术移植比喻为"要求男性生育",形象地指出数字世界模型与物理控制需求之间的本质差异。他特别提到GPT-6等数字基模的进化可能带来的冲击:当基础模型能力发生质变时,所有基于其开发的下游应用都可能面临价值重构的风险。这种判断与自动驾驶领域的发展逻辑高度契合——当基础数据积累达到临界点后,行业竞争的核心将转向对极端场景(corner case)的覆盖能力。
灵波的解决方案是构建完全独立的物理世界模型体系。其7月发布的LingBot-VA 2.0模型采用自回归架构,通过语义视觉动作分词器、严格因果预训练等技术创新,在单块GPU上实现了150Hz的实时推理效率。更值得关注的是LingBot-VLA 2.0模型,该模型预训练阶段融入了6万小时真实物理数据,覆盖17家厂商的20种机器人构型,其推理耗时在RTX 4090显卡上被压缩至130毫秒以内,且相关代码已全部开源。数据显示,截至8月,LingBot系列在开源社区累计获得约29.8K星标,并被毕马威、招银国际等机构的研究报告引用。
在数据战略层面,灵波构建了独特的闭环体系。首席数据科学家黄用韬带领团队建立了从数据采集到模型训练的全流程优化机制,通过定制化采集策略将数据可用率从行业平均的15%提升至90%以上。朱兴特别强调数据分布的重要性:"就像炼丹需要配方,模型训练的关键在于如何定义数据类型、场景覆盖和任务分布。"这种理念已转化为组织能力——数据部门不再被视为成本中心,而是成为与算法研发同等重要的核心技术部门。
市场落地方面,灵波选择了国大药房智慧机器人和工业上下料作为核心场景。在上海国大药房东靖路门店,机器人可在不改造现有货架的条件下,完成接单、导航、药品识别、抓取和配送全流程,单次取药平均耗时不足3分钟,覆盖150余种常见药品。这种选择与蚂蚁集团的生活服务基因深度契合:药房场景既需要处理与人交互的安全问题,又要应对数千种SKU的泛化挑战,恰好构成机器人进入家庭环境的前哨站。朱兴坦言:"我们不是要打造无人药房,而是让机器人成为药师的有效助手。"
对于商业化节奏,灵波表现出罕见的克制。朱兴明确表示不会为追求短期收入规模而过度扩张,但同时强调"只有付费场景才能提供真实反馈"。他设定了两个关键指标:一是实际部署的机器人数量,二是后训练与数据成本在相同场景下的指数级下降。在战略边界上,灵波坚持只做机器人大脑开发,通过闭源基模加开源工具链的模式与本体厂商合作,目前已与乐聚等企业建立数据回流的正向循环。
行业格局正在发生深刻变化。资本市场对机器人大脑层的投资热度持续升温,Skild AI、Physical Intelligence等独立公司均获得数十亿美元估值,其核心价值在于模型跨本体复用的平台能力。与此同时,本体厂商也开始加大大脑研发投入,宇树科技在募资计划中将48%的资金用于模型开发,招股书直言自研大模型尚未实现规模化应用。
面对融资质疑,朱兴回应称资金将主要用于人才激励和公司治理升级。他判断具身智能领域正进入"百模大战"的初级阶段,最终将像大语言模型领域那样收敛为少数几家主导企业。灵波选择的原生路线虽然充满挑战,但其核心逻辑清晰可见:通过物理真实数据构建独立于数字世界的智能体系,这条道路的可行性正在多个落地场景中得到验证。











