大晓机器人与南洋理工大学S-Lab等科研团队近日联合推出了一项突破性成果——统一多模态世界模型框架Puffin-World,并同步开源相关代码、模型及数据集。该框架首次将物理状态、几何结构与视觉外观整合为三维世界的三种原生属性,构建了覆盖重力场感知、空间仿真、三维重建及闭环探索的完整技术体系,为机器人空间智能与具身智能训练提供了全新解决方案。
传统机器人训练依赖的环境信息往往局限于视觉呈现,但实际场景中,相机姿态、重力稳定性、空间连续性等物理参数同样关键。例如,机器人移动后能否准确预测新视角下的场景变化,取决于其对三维世界状态的全面理解。Puffin-World突破了单一模态的局限,通过统一框架同时处理物理方向、空间几何与视觉外观的交互关系,使模型能够从一张图片中解析相机姿态、场景结构及语义信息,甚至预测修正动作后的目标观测结果。
该框架的核心能力体现在四大任务整合上。其一,单图空间推理功能可基于地平线、垂直结构等线索,计算相机相对于真实世界的横滚角、俯仰角及视场角,同时生成场景语义描述,实现“看到什么”与“如何看到”的双重解析。其二,自由视点仿真技术允许用户通过文字或参数指定相机方向,模型据此生成符合目标视角的画面,将文生图的控制精度从内容层面延伸至空间维度。其三,三维世界重建支持从文字、单图或少量参考图像出发,沿指定轨迹生成多视角画面,并预测各视角的深度信息,最终融合为具有一致空间结构的三维模型。其四,闭环自校准机制通过“感知状态—预测动作—生成结果—动态校准”的循环,使模型在相机姿态偏离时自动修正,确保空间探索的连续性与准确性。
为推动技术落地,研究团队同步开源了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组及100万条复杂旋转轨迹,并标注了28个公开数据集的约4450万张图像的绝对相机位姿。这一资源库不仅覆盖了多样化的场景类型,还通过高精度标注解决了机器人训练中数据稀缺的痛点,为仿真环境构建、合成数据生成及具身智能算法开发提供了可复现的技术底座。
据悉,Puffin-World的开源代码与模型已面向全球研究者开放,其模块化设计支持快速集成至现有机器人系统。随着空间智能技术的演进,这一框架有望在自动驾驶、工业自动化、服务机器人等领域引发新一轮创新应用。











