北京人形机器人创新中心近日宣布,其研发的Pelican-Unify大模型正式亮相世界机器人大会。这款被业界称为全国首个统一表征具身世界模型的系统,整合了视觉理解、动作操控和世界建模等多项核心能力,标志着具身智能领域向"大一统"技术架构迈出关键一步。
项目负责人张怡在发布会上指出,当前具身智能发展面临模型结构、训练范式和数据标准尚未统一的挑战。她强调不应过早否定VLA(视觉-语言-动作)架构,认为世界模型与现有技术路线可通过持续探索实现融合发展。"各技术路径可独立迭代,逐步积累关键技术经验,最终实现收敛。"这种观点与部分研究者将世界模型比作"永动机"的质疑形成鲜明对比。
多模态大模型专家代勇将当前具身智能发展阶段类比为自然语言处理领域的Bert时期。他解释称,这个阶段存在模型结构多样化、训练范式未定型的特点,就像Bert时代需要根据不同任务训练专用模型。但这种技术分散状态反而为研究者提供了广阔的创新空间,"正如Bert到GPT的演进过程,现在正是最具探索价值的时期"。
前华为AI首席专家唐都钰透露,其团队正在筹备创业项目,计划开发"主动式物理因果大模型"。该方案拟在多模态感知与执行层之间构建主动认知规划模块,形成可跨设备迁移的物理模型。他特别指出,技术不确定性为初创团队创造了独特机遇,"在技术路线尚未收敛时,创新探索比算力堆砌更重要"。
北京人形大模型团队负责人鞠笑竹透露,近期训练工作中频繁出现的突破性进展(Aha Moment),增强了团队对技术路线的信心。这种信心既源于对自身模型能力的评估,也基于对具身技术发展规律的认知——在技术早期阶段,多样化的探索尝试反而能加速整体进步。
针对世界模型的技术争议,代勇提出务实观点:完全依赖仿真训练的闭环系统存在"鸡生蛋"悖论,当前技术条件下难以实现。他强调具身智能发展需要脚踏实地,"就像培育植物需要翻土、播种、施肥,技术突破需要找到合适的应用场景、优化架构设计、积累高质量数据"。这种观点得到多位业内专家的认同。
据技术白皮书显示,Pelican-Unify模型通过统一表征框架,实现了不同模态数据的语义对齐。在机器人操作任务中,该模型展现出跨场景迁移能力,较传统专用模型训练效率提升40%。研发团队表示,后续将开放部分技术模块,与学术界共建评测标准体系。
这场技术路线之争折射出具身智能领域的现实困境:既要避免过早技术收敛导致的创新停滞,又要防止过度分散投入造成的资源浪费。随着头部企业陆续发布统一架构模型,行业正从"百模大战"转向"架构整合"的新阶段,技术标准制定和场景落地能力将成为竞争焦点。











