当行业还在为几秒钟的“电子榨菜”视频卷得不可开交时,李飞飞创立的World Labs公司悄然抛出一枚重磅炸弹——全球首个多模态世界模型Atlas正式亮相。这款从零开始预训练的模型,不仅打破了传统视频生成对提示词的高度依赖,更以相机位姿参数作为原生输入,让用户仅需提供1至6张普通照片,就能生成长达1分钟、分辨率达1440p的动态视频,且镜头运动与空间几何的连贯性远超现有技术。
Atlas的核心突破在于将“空间上下文”编码为模型底层逻辑。与传统视频生成工具依赖提示词“玄学抽奖”不同,它通过绑定三维坐标与深度信息,在虚拟空间中构建出带轴网的立体框架。当用户输入多视角图像时,模型会自动推算各画面间的相对位置,补全未拍摄区域,最终生成可连续漫游的三维场景。即便是单张照片,Atlas也能借助模型先验“脑补”出完整场景——输入机器人正面照,它能补全背影;给一张泳池边角照,它甚至能“修复”出未入镜的草坪与远山。
在空间重建领域,Atlas的表现堪称颠覆性。传统3D扫描需专业设备拍摄数百张照片,而Atlas仅需2至25张游客视角的地面照片,就能还原斯坦福大学Main Quad的草坪、拱廊及教堂外墙细节,并支持上帝视角的航拍漫游。在DTU、ETH3D等公开数据集上,其稀疏视角重建误差指标远低于Pi3X、Depth Anything 3等同类技术,输出结果更可直接对接点云与3D高斯泼溅渲染,实现高帧率即时渲染。
更令人惊叹的是Atlas的“子弹时间”能力。研究人员仅用三五个普通手机拍摄的日常打闹视频,经模型处理后,用户便可在虚拟空间中自由切换视角,复刻《黑客帝国》中的经典镜头。这种能力源于Atlas对多视角合成的深度优化——它不仅能融合零散画面,还能强制关联两个毫无关联的场景,通过脑补走廊、大门等过渡空间,实现场景的无缝拼接。
Atlas的技术底座是一套融合四大范式的“多模态自回归扩散Transformer”架构。该架构原生支持文本、图像、相机位姿与3D深度的融合处理,通过自回归机制逐级预测空间状态变化,并借助扩散模型的去噪技术确保画质与几何精度。其Transformer结构更可无缝适配现有算力集群,享受语言模型领域的KV缓存与分布式推理优化。在真人盲测中,Atlas以75%至94%的胜率碾压MiniMax H3、Gemini Omni Flash等主流模型,尤其在镜头运动控制方面展现压倒性优势。
尽管图像生成并非Atlas的主攻方向,但它仍展现出强大的跨模态能力。从复杂提示词解析到文字渲染,从写实风格到油画、漫画,Atlas均能轻松驾驭。更突破性的是,它可直接根据文字或图片生成360度全景图——这一功能需模型同时处理前后左右的空间连续性,对空间理解的要求远高于普通文生图任务。
World Labs将Atlas的终极目标指向具身智能与机器人训练。当前机器人训练面临两大痛点:真实场景数据采集成本高昂,仿真环境搭建耗时费力。Atlas的“现实到仿真”路线,则可通过手机拍摄的现场视频,直接生成高精度3D物理空间,供机器人在虚拟环境中“跑图”试错。无论是机械臂操作刚性箱子、铰链柜门,还是捏压软体海绵,Atlas都能模拟出精准的受力反馈,并衍生出千万种光照、摆放与障碍物条件组合。
从ImageNet奠定计算机视觉基础,到斯坦福实验室深耕“视觉+机器人学习”,再到创办World Labs,李飞飞的科研轨迹始终围绕一个核心命题:机器能否真正理解图像背后的三维世界?当大语言模型在文字领域展现惊人能力时,Atlas所代表的空间智能,正试图为机器补上关于几何、物理与行动的世界经验——这或许才是AI从数字世界走向现实的关键入场券。











