“AI 教母”李飞飞创立的科技公司 World Labs 近日宣布,正式推出全球首个多模态世界模型 Atlas。该模型凭借像素级精确的相机控制能力,可生成高质量图像与视频帧,并实现三维场景重建,在人工智能生成领域引发广泛关注。

据 World Labs 官方介绍,Atlas 从底层架构开始进行预训练设计,支持多模态输入交互。用户可通过输入相机移动轨迹等动态参数,直接生成对应视角的三维视图。这种技术突破使得模型能够精准定位空间中的多个输入视角,为图像和视频生成提供类似“子弹时间”的动态控制效果——即通过固定场景中的多角度拍摄,实现时间凝固般的视觉呈现。
在三维重建能力方面,Atlas 展现出显著优势。该模型仅需单张或多张输入图像,即可输出结构精确的三维模型,其重建精度超越当前主流开源模型。更值得关注的是,Atlas 具备场景扩展能力:当用户指定任意摄像机位置和角度时,模型不仅能生成与原始图像内容匹配的新视图,还能自主补全画面中未被拍摄到的区域,实现图像的平滑扩展。
技术团队详细拆解了 Atlas 的四大核心功能:在相机控制生成领域,模型支持从单张图像生成最长1分钟的1440p高清视频,通过像素级参数调整实现镜头运动控制;空间重建模块可处理从单张到数十张图像的输入,既能生成新视角图像帧,也能直接输出显式三维模型;时空模拟功能通过解析视频中的空间-时间关系,可重构视频画面以增强戏剧效果,并支持机器人系统的虚实映射训练;图像生成模块则突破传统文本到图像的局限,支持360度全景生成与复杂文本指令渲染,覆盖多种视觉风格需求。

目前,World Labs 已向部分行业合作伙伴开放 Atlas 的抢先体验权限,早期访问通道预计在未来数周内逐步启动。这项技术有望在影视制作、游戏开发、虚拟现实等领域引发变革,其动态场景生成与三维重建能力或将重新定义数字内容创作的工作流程。












