ITBear旗下自媒体矩阵:

国产世界模型UniWorld-View登顶李飞飞榜单!适配国产算力且代码全开源,引领视觉AI新突破

   时间:2026-07-25 02:07:32 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

李飞飞团队主导的世界模型评测榜单迎来新变动,由兔展智能联合北京大学、鹏城实验室研发的UniWorld-View模型成功登顶。该模型突破传统技术框架,实现单张图片或视频生成任意视角新内容的功能,并完成国产昇腾算力适配,相关代码与模型权重已全面开源。

在技术实现层面,研究团队针对"大基线视角合成"这一核心难题提出创新方案。传统方法在处理正脸到后脑勺这类极端视角转换时,往往因几何信息缺失导致画面扭曲或伪影。UniWorld-View通过"遮挡感知点云渲染"技术,采用双重投影算法精准识别遮挡区域,结合法向过滤机制剔除无效点云,使渲染图几何结构误差降低72%。实验数据显示,在动态场景测试中,模型生成的360度环绕视频质量评分较前代方法提升41%。

该模型采用独特的双分支架构设计,将几何控制与内容生成解耦。几何流分支通过编码渲染图与遮挡掩码,确保空间结构准确性;外观流分支引入Ref-DiT模块,以新视角特征为引导,从原始视频中智能提取匹配素材。这种分工机制使模型既能保持目标物体形态,又能复现原始视频的纹理细节,在人物面部合成测试中实现98.7%的相似度匹配。

在4D场景重建领域,研究团队提出时空解耦生成策略。模型首先冻结时间维度生成静态环绕视图作为空间锚点,再通过多机位同步生成动态序列。这种分阶段处理方式使4D重建效率提升3倍,在动态场景测试中,重建精度达到0.89毫米级,较传统方法提升58%。生成的4D场景支持实时交互漫游,已在数字孪生、影视制作等领域开展应用测试。

技术溯源显示,该成果依托兔展智能长期积累的视觉大模型研发能力。作为国内视觉AI领域代表企业,其2025年发布的UniWorld-V2模型已率先实现理解与生成架构统一,较国际同类产品NanoBanana提前3个月完成技术突破。2026年推出的V2.5版本在图文交错生成、复杂文字处理等场景达到GPT-Image-2同等水平,代码引用量位居全球开源项目前列。

据研发团队介绍,UniWorld-View的训练数据来自北京大学系初创企业元空智能提供的多模态数据集,包含超过200万组动态场景样本。当前模型已支持1080P分辨率实时生成,在消费级显卡上可达15FPS处理速度。研究团队正与多家影视制作公司合作,探索将该技术应用于虚拟制片流程,预计可减少60%的外景拍摄成本。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version