在2026世界人工智能大会(WAIC)“智启具身论坛”上,智元合伙人、觅蜂科技董事长兼CEO姚卯青接受媒体采访时指出,当前具身智能行业面临数据、算力与路径选择三大核心挑战。他直言:“仅靠示教模仿学习,机器人难以突破现有能力边界。”这一观点直指行业从实验室走向产业应用过程中的关键瓶颈。
数据缺口成为制约具身智能发展的首要难题。姚卯青透露,当前行业积累的具身数据规模与语言模型预训练语料存在“万倍级差距”。要实现机器人对通用物理规律的理解和开放式任务规划,至少需要亿小时级数据支撑,才能使基础任务成功率达到70%-80%。觅蜂科技通过众包模式采集人类操作视频,将数据成本降至传统遥操作的三分之一,目前已积累百万小时级数据,目标在年内突破千万小时。但姚卯青强调,高质量真机遥操作数据仍是后训练阶段不可或缺的“金字塔尖”资源。
算力瓶颈随着模型复杂度提升日益凸显。虽然国产端侧平台已在部分场景落地,但现有模型参数量普遍低于100亿,难以支撑智能涌现所需的多模态融合。姚卯青指出,推进至百亿参数级MOE架构时,国内外现有平台在算力和显存通信带宽上均存在明显短板,产业链需加速向下一代平台演进。他以智元GO系列机器人为例,当前边缘端推理频率仅能实现10-20赫兹,距离实时响应仍有差距。
技术路径分歧中,语言模块的重要性成为行业共识。针对端到端VLA模型与世界模型(WAM)的争论,姚卯青提出“世界推理动作大模型”(WRAM)概念。他以动物杂技表演与家务整理的对比说明,单纯运动能力无法实现复杂任务规划,必须融入语言知识体系。“未来基座模型需具备理解-生成一体化能力,既能解析指令规划路径,又能预测画面生成动作轨迹。”这种多模态融合架构需通过可扩展的离散自回归Transformer实现,以消化百万级小时数据。
商业化进程的加速为行业注入信心。姚卯青透露,过去一年具身机器人已从实验室走向工厂产线,实现24小时连续运行,软件成功率达到99.99%。项目落地周期从首批的3-4个月缩短至二次开发的1-2周,边际成本快速下降。对于大厂入局现象,他持开放态度:“更多参与者能加速数据规模扩张,1亿小时数据目标需要全行业共同努力。”基于当前技术进展,他预测2027年底至2028年初或将迎来物理AI的“GPT-3.5时刻”,届时机器人将展现出更强的指令跟随和零样本操作泛化能力。









