大晓机器人与南洋理工大学S-Lab等机构联合研发的统一多模态世界模型框架Puffin-World正式开源,为空间智能与具身智能领域带来突破性进展。该框架首次将物理状态、几何状态与外观状态定义为三维世界的三种原生要素,通过整合重力场感知、自由视点仿真、三维重建及闭环探索能力,实现了对机器人行动后世界状态的精准预测。这一创新为机器人训练提供了更接近真实环境的支撑,解决了传统方法仅依赖视觉逼真度而忽视环境信息完整性的局限。
Puffin-World的核心创新在于其三维状态建模体系。物理状态通过重力场与纬度图定义相机绝对朝向,几何状态以深度信息刻画场景三维结构,外观状态则对应RGB图像输出。三者协同构建了从“世界本质”到“交互逻辑”的完整表达。例如,当模型生成新视角时,不仅需呈现符合视觉逻辑的画面,还需确保物理方向与空间结构的合理性。为统一绝对方向与跨视角运动,研究团队提出Omni-Camera相机表示法,将重力锚定的绝对信息与射线相对几何结合,使生成过程始终保持稳定的物理参照系,有效避免了地平线漂移或场景失真问题。
该框架的另一突破在于实现世界生成与重建的同步进行。传统方法需先生成视频再通过独立模块补充深度信息,而Puffin-World可在单次生成中联合输出RGB外观与深度几何数据。这一特性使其直接支持三维重建任务,例如从文字或少量图像生成符合指定相机轨迹的多视角数据,并汇聚为具有一致空间结构的三维场景。在闭环探索任务中,模型还能通过“状态感知-动作预测-结果生成-校准修正”的循环机制,自主修正相机姿态偏差,高效扮演世界行动模型(WAM)角色。
为支撑复杂空间理解能力,研究团队构建了包含1600万核心数据的Puffin-16M数据集。其中Puffin-Cam-15M提供1500万组视觉-语言-相机三元组,覆盖室内外、真实合成等多元场景,并标注不同分辨率、相机姿态及视场角信息;Puffin-Traj-1M则包含100万条挑战性旋转轨迹,涵盖连续俯仰、横滚及360度环视等复杂运动模式。团队还为28个公开数据集补充了约4450万张图像的绝对相机位姿标注,标注内容涵盖横滚角、俯仰角及视场角,为物理世界感知研究提供了大规模监督数据。
在技术验证环节,Puffin-World在四项基准测试中均取得领先成绩。在相机物理理解任务中,该模型在Stanford2D3D数据集上对横滚角、俯仰角的中位误差分别低至0.29度与0.53度;在相机可控生成测试中,其生成画面的重力方向误差仅为0.79度,FID指标达75.93;在三维世界生成任务中,PSNR指标达到17.22,显著优于对比方法。这些数据表明,该框架成功建立了相机理解、空间控制、几何生成与三维重建之间的协同机制,而非单纯优化单一任务表现。
目前,Puffin-World已同步开源代码、模型及数据集,形成覆盖数据标注、模型训练到效果评测的完整技术链路。这一开放策略将加速机器人仿真、合成数据生成及具身智能训练等领域的技术迭代,为三维内容生产与虚拟现实应用提供新的解决方案。通过将世界模型从视觉内容生成推向可感知、可校准的三维环境预测,该研究为机器人训练范式转型提供了关键技术支撑。











