在浙江某仓库内,机器人叉车正将货物从货架上取下。同样的操作,工人仅需三十秒,而机器人耗时超过一分钟,遇到未预见的状况时,还会短暂停顿,仿佛陷入思考。这一场景引发了一个关键问题:具备智能的机器人何时能追上人类效率?蚂蚁灵波CEO朱兴在闭门沟通会上回应称,脱离成功率谈效率意义有限。他指出,慢速是技术问题,总有解决方案,但机器人能否完成任务才是核心,这要求其具备对复杂真实世界的理解力,即泛化能力,而数据是这一挑战的关键。
蚂蚁灵波作为蚂蚁集团旗下的具身智能公司,近期连续发布六款模型,涵盖视觉、空间感知、VLA、世界模型及动作模型等领域。成立仅一年半,该公司已推出十余款模型,形成1.0和2.0两代全栈大脑,其中包括行业首个具身原生世界动作模型LingBot-VA 2.0。与此同时,灵波宣布启动首轮融资,拟募资15亿元,并计划年底前推进第二轮融资,引发市场对其技术路径的关注:不押注机器人本体,资本为何愿意为其定价?
海外案例提供了直接参照。Physical Intelligence和Skild AI虽不擅长机器人硬件制造,却凭借跨本体模型和物理智能获得高估值。而以本体和运动控制见长的宇树科技,也将具身智能模型研发纳入IPO募投方向。2024年,具身行业焦点逐渐从硬件转向智能层,“大脑”成为技术竞争的核心。蚂蚁灵波在成立之初便选择专注机器人大脑,这一逆向决策在2026年显现出前瞻性。
语言模型的局限性促使行业探索物理AI的突破。李飞飞在《From Words to Worlds》中指出,大语言模型虽雄辩但缺乏经验根基,而物理AI能串联想象力、感知与行动,为人类开辟新可能。OpenAI组建机器人团队、英伟达扩展Cosmos和GEAR等物理模型,均体现大公司对这一领域的布局。蚂蚁集团布局具身智能,既源于其“生活服务”业务需求——数字服务需进入物理世界,也基于技术洞察:机器人智能发展已进入具身智能阶段,而大脑是当前突破的关键。
具身智能的“大小脑”架构分野明显。大脑负责语义理解、逻辑推理等认知决策,小脑则主导操作与移动等执行模块。朱兴认为,尽管小脑发展使大脑验证成为可能,但物理智能服务人类的核心瓶颈仍在于大脑。首席科学家沈宇军以“开门见猫”为例解释技术挑战:数字模型可识别玻璃门后的猫,但物理机器人需通过深度感知判断猫的实际位置。物理世界的数据复杂度远超数字内容,实验室环境难以覆盖真实场景中的动态需求,如抬手取物、弯腰操作等。
行业主流大脑方案分为VLA和世界动作模型(WAM)两类。VLA源于多模态大模型,落地较快;WAM基于视频生成模型,擅长动态预测。然而,两者均继承数字世界模型的设计逻辑,面临物理世界适应性不足的问题。灵波选择“具身原生”路径,从物理需求出发重新设计数据、训练目标和模型架构。例如,其世界动作模型LingBot-VA 2.0未采用通用视频模型改造,而是从语义视觉-动作VAE、单向因果建模到MoE架构均独立开发,并通过预训练完成基础能力构建。
全栈大脑布局是灵波技术落地的关键。公司构建了从视觉、空间感知到世界预测和动作执行的完整模型体系。沈宇军指出,在技术未收敛阶段,全栈路径便于定位问题:若直接推进统一模型,训练失败时难以判断具体环节的缺陷。例如,VLA需精准空间感知,故开发LingBot-Depth;WAM需符合物理规律的视频生成底座,故训练LingBot-Video。这些探索最终汇聚于LingBot-VA 2.0,形成分层解决问题的能力框架。
面对“成立不足两年如何快速发布十款模型”的质疑,朱兴从时间和基础设施两方面回应。灵波虽于2024年底注册,但技术探索始于蚂蚁技术研究院时期,核心团队整建制转入。2025年上半年,公司完成招聘、数据准备和技术基建,年底推出1.0系列,2026年上半年实现模型投产,叠加具身原生突破后发布2.0系列。基础设施方面,蚂蚁集团百灵团队训练过1T参数规模大模型的经验,为灵波提供了算力、存储、数据处理和工程体系的支撑。灵波还自建数据闭环系统,通过压缩迭代周期(Latency)加速模型与数据的协同优化。
在硬件定位上,灵波保持中立,不押注本体,而是通过预训练解决跨构型泛化问题。朱兴解释,预训练阶段接触多种构型数据后,模型可天然适配不同硬件,降低落地成本并提高成功率。这一策略鼓励生态伙伴提供更多数据,形成技术-数据-落地的正向循环。例如,乐聚智能基于LingBot-VLA 2.0模型,仅需300条数据和1-2天微调即可跑通场景测试,得益于灵波预训练中使用了乐聚真机数据。
灵波正构建数据与本体双生态。数据生态方面,公司通过自采和合作扩大规模;本体生态方面,LingBot-VLA 2.0已支持17家厂商的20余种机器人构型,多元硬件场景带来更丰富的数据分布。朱兴强调,当前具身行业需优先解决落地成功率问题,再追求效率。帮助厂商实现PMF(产品市场契合)是推动行业发展的关键一环。类似安卓或ARM的生态策略,灵波通过中立性和兼容性吸引合作伙伴,形成“大脑-数据-本体”的闭环。
中国在物理AI领域具备独特优势:全球领先的硬件供应链和运控能力、丰富的场景数据以及高密度的人才储备。具身行业的PMF需同时满足数据循环、收入循环和本体规模扩大三要素。蚂蚁灵波希望通过大脑底座整合中国优势,形成“本体产生数据-数据优化模型-模型降低成本”的闭环。这一路径与支付宝从支付基础设施到生态的扩张逻辑相似,均以核心能力为支点撬动行业生态。
灵波的开源策略进一步推动生态建设。其发布的模型中,绝大部分实现高自由度开源,并配套开放数据集和工具链。例如,开源LingBot-Depth时同步发布300万对RGB-深度配对数据集,LingBot-VLA则开源完整后训练工具链。沈宇军表示,公司愿将评价权交给社区,通过真实反馈验证模型实用性。尽管通往具身智能AGI的道路仍漫长,但行业已看到“scaling”生态的潜力,而专注大脑路线的技术团队正成为不可忽视的力量。











