在机器人技术领域,一场关于“大脑”与“小脑”的争论正愈演愈烈。以运动控制见长的宇树科技,凭借其四足机器人和人形机器人产品占据全球出货量榜首,但其创始人王兴兴坦言,当前制约机器人大规模应用的核心瓶颈,在于具身智能的泛化能力不足。这种“小脑强于大脑”的现状,折射出整个行业在物理世界认知层面的集体困境。
具身智能的突破难点集中体现在“最后一厘米”的执行偏差上。王兴兴在2026世界机器人大会上指出,即便机器人能完成跑跳等复杂动作,任务执行中的微小误差仍会导致成功率骤降。这种困境在家庭服务场景中尤为突出——当机器人试图将咖啡杯放在桌边时,1厘米的定位偏差就可能引发倾倒事故。斯坦福大学教授李飞飞将此现象归结为空间智能的缺失,强调AI必须建立对三维环境的几何认知能力。
世界模型作为破解这一难题的关键技术,正引发学术界与产业界的激烈争论。图灵奖得主杨立昆主张通过“隐空间”学习模式,让AI在抽象维度预测未来状态。meta推出的V-JEPA 2模型虽能捕捉“杯子会摔碎”的因果关系,却因抽象空间不可见而面临工程化难题。与之形成对比的是生成式路线,Sora等视频模型通过海量数据训练生成合理画面,却常出现物理规律错误——飞行的猪群、消失的物体等超现实场景屡见不鲜。
数据瓶颈成为制约世界模型发展的核心因素。北京智源人工智能研究院院长王仲远指出,视频生成模型依赖的传感器数据与大语言模型使用的文本数据存在本质差异。前者需要处理每秒数千帧的实时信息流,后者则基于人类加工过的二手经验。V-JEPA 2虽仅12亿参数,却需消耗超百万小时视频训练,这种数据需求规模远超现有技术供给能力。更严峻的是,模型误差会随时间累积,当前最强系统仅能维持数分钟物理一致性,距离工业级应用要求的连续一小时模拟相差甚远。
自动驾驶领域成为世界模型最早的试验场。特斯拉通过车队回传数据构建的神经世界模拟器,已能生成与真实道路高度吻合的虚拟环境。这种“数据采集-模型训练-场景验证”的闭环系统,被快思慢想研究院院长田丰视为短期突破口。他特别强调真实数据与虚拟数据的成本拐点:“当虚拟训练成功率超过真实数据采集成本时,行业将迎来颠覆性变革。”但这种变革尚未扩展至其他领域,复旦大学通用物理智能研究院院长苏昊坦言,人形机器人等复杂场景仍需解决物体交互、多模态感知等额外挑战。
技术路线的分歧在学术界持续发酵。李飞飞团队开发的Marble模型虽能生成高精度3D世界,却因算力需求巨大难以推广;杨立昆的隐空间方案则面临可解释性困境。这种局面导致世界模型缺乏统一评估标准,行业不得不通过下游任务间接验证效果。田丰比喻称:“这就像用考试成绩反推知识掌握程度,中间始终隔着无法直接测量的认知鸿沟。”
尽管挑战重重,世界模型的应用前景仍吸引着巨额资本投入。在工业制造领域,波士顿咨询预测到2030年,具备物理认知能力的机器人将降低30%的生产事故率;医疗场景中,强生公司正在测试能模拟组织切割的手术机器人训练系统。这些应用都依赖于世界模型对液体流动、材料形变等复杂物理过程的精准建模。正如王兴兴所言:“当机器人能像人类一样理解‘松手会摔碎’背后的物理规律时,真正的智能革命才刚刚开始。”







