ITBear旗下自媒体矩阵:

李飞飞团队发布多模态世界模型Atlas:新视角预测或引领AGI新方向

   时间:2026-09-07 20:08:10 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

人工智能领域迎来重要突破,由李飞飞领衔的World Labs团队近日在a16z访谈中首次完整展示了其研发的多模态世界模型Atlas。该模型突破传统生成框架,通过"新视角预测"机制重新定义了三维空间理解方式,为通用人工智能发展开辟了全新路径。

区别于大语言模型依赖的token预测机制和视频模型的帧预测逻辑,Atlas的核心创新在于构建了空间连续性理解能力。用户输入少量场景图像或文字描述后,系统可生成任意时空位置的画面,实现文字、图像、视频、3D模型及相机参数等多模态数据的原生融合。研发团队强调,这种空间预测能力与语言模型的token预测具有同等重要的基础地位,可能成为通向AGI的关键技术原语。

在三维重建领域,Atlas展现出颠覆性优势。传统方法需要数百张照片才能构建完整场景,而该模型仅需几张至几十张图像即可完成重建。实验数据显示,使用三部iPhone拍摄的画面就能生成专业级子弹时间特效视频。这种突破源于模型架构的重大革新——摒弃前代Marble模型的高斯泼溅表示法,转而采用新视角预测作为基础运算单元,有效解决了3D重建中的盲区问题,同时扩展了空间上下文处理能力。

技术突破正催生广泛的应用场景。在创意设计领域,模型可生成具有严格3D一致性的内容,显著降低制作成本;建筑行业利用其高精度空间预测能力优化设计流程;机器人领域则通过仿真环境转换提升训练效率,缓解数据匮乏难题。特别值得关注的是,模型已具备初步动态处理能力,未来将重点发展动态效果渲染、内容编辑及人机交互功能。

研发团队透露,Atlas的演进路线包含三个关键方向:提升动态场景处理精度、开发直观的内容编辑工具、构建自然的人机交互界面。最终目标是打造普通用户可直接操作的3D虚拟世界交互系统,使非专业人士也能轻松创建和修改三维内容。这项技术正在与多个行业展开深度合作测试,预计将在年内推出开发者版本。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version