在人工智能领域,世界模型正成为备受瞩目的新方向。从空间智能到具身智能,从表征预测到可交互环境,众多研究团队和产业机构纷纷将目光投向“理解世界”这一目标。如今,行业竞争的焦点已从“是否涉足世界模型”转向“以何种技术路径实现世界模型”。
AI基础模型公司Video Rebirth选择了一条独特的道路——视频原生路径。该公司以视频作为理解与生成世界的基础载体,在具备工业级视频生成能力后,进一步构建实时、可交互的世界模型。其阶段性成果——世界模型Olympus,以希腊神话中众神俯瞰世界的奥林匹斯山命名,旨在构建能够理解并模拟世界运行规律的模型。
Video Rebirth认为,视频生成解决的是“如何呈现世界”的问题,属于感知层面;而世界模型则聚焦于“如何理解世界的运转机制”,属于认知层面。大语言模型主要压缩人类已记录的知识,但物体运动、光照变化等物理规律难以用文字完整描述,更依赖从数据中学习并内化。Olympus正是专注于这类能力的培养。
体验Olympus的方式类似于玩一款由AI实时生成的游戏。用户进入一个实时生成的3D场景,通过移动、跳跃等按键操控角色,避开障碍、攀爬树木和山体,画面随操作即时生成并响应。这种体验背后,是Olympus“实时可交互”的核心特质——用户下达指令的瞬间,世界便立即呈现并回应。
Olympus的野心不止于此。它并非仅针对特定场景的模型,而是致力于成为统一的世界模型,用同一套底层能力同时覆盖数字世界与物理世界。这意味着它既能服务数字环境中的交互,也能应用于机器人、自动驾驶等需要与真实物理世界互动的场景。
衡量世界模型的维度包括分辨率、时长和交互方式,但Video Rebirth更注重三个“一致性”。首先是逼真的物理一致性:在Olympus生成的世界中,角色能完成避障、攀爬等连续动作,物体运动和场景结构在不同视角和动作中保持一致,避免穿帮、穿模或错乱。其次是声画同步的一致性:角色在草地上的脚步声、起跳落地的声响等,都与画面动作精准贴合,确保沉浸感。最后是长程记忆一致性:用户离开一处环境后返回,场景仍保持原样,这需要模型具备“记住”能力。
Olympus的技术内核建立在Video Rebirth的视频生成引擎BACH之上。2026年5月,BACH在Artificial Analysis Video Arena的独立盲测中首次登榜便位列全球第六,是榜单上排名最高的初创公司模型。Video Rebirth认为,工业级视频生成能力是构建真实、连贯世界模型的基础。
Olympus的训练分为三个阶段:首先在大规模可交互场景数据上进行领域微调,让模型熟悉可交互世界的生成;其次引入因果建模与控制注入技术,教会模型根据历史画面和当前动作生成后续画面;最后通过自回归蒸馏提升生成效率和连贯性,支持长时间稳定交互。值得注意的是,Olympus并未通过编码物理公式来理解世界,而是从数据中隐式学习物体运动、碰撞和光照变化等规律。
Olympus的实时响应能力是其关键优势。用户输入的每个按键或指令都会被编码为嵌入向量,通过交叉注意力机制调制后续画面生成,实现操作与画面的无缝衔接。为保持长程记忆,Olympus采用两种策略:一是录制场景重访数据,训练模型“记住来时的路”;二是在推理阶段高效检索并复用历史状态,避免每帧都从零开始理解世界。
实现“实时”是一项工程挑战。Olympus通过多卡并行、状态缓存和异步计算等推理加速策略,将不同模态的计算拆分到多张计算卡上同时进行,存储场景初始状态以避免重复加载,并让解码与KV缓存等环节并行推进。这些策略共同支撑起流畅的交互体验。
Olympus是已知最早在AMD MI350系列上部署并运行的世界模型。MI350系列配备的288GB HBM3E超大显存,为Olympus在长时序、复杂场景和高并发交互下缓存中间状态提供了充足空间,进一步放大了系统优化的效果。这体现了Video Rebirth与AMD在算力基础设施上的深度协同。
支撑Olympus不断进步的是一个由真实世界视频和合成数据共同驱动的飞轮。真实视频提供丰富的物理和视觉信息,但“动作-画面”对应关系模糊;合成数据则提供精准的配对,例如游戏场景中按键操作与画面变化的明确关系。两者互补,循环迭代,推动模型能力持续提升。
业界通往世界模型的路径大致分为三条。第一条是三维显式路线,以李飞飞教授创立的World Labs为代表,通过还原三维空间生成和模拟世界,擅长表达结构化物理世界,但在形变、流体等现象上表现有限。第二条是视频隐式路线,与杨立昆教授倡导的思路相近,在抽象表征空间中预测世界状态,不直接生成可视化输出,聚焦理解能力。第三条是Video Rebirth选择的视频显式路线,以视频为原生载体,直接从海量视频中学习世界规律并生成可交互世界。Video Rebirth认为,视频是蕴含时空信息的“4D数据”,既能保留物理信息,又能生成可交互世界。
Video Rebirth首席战略官李迪夫表示,公司的战略是将Olympus定位为连接数字世界和物理世界的桥梁,从基本规律层面理解现实世界,并结合因果推理预测未来状态。公司希望用同一套底层能力覆盖两个世界,实现独特的扩展规律,这一信念决定了从数据到架构的所有选择。
对Video Rebirth而言,世界模型是通往下一代智能体的基础。创始人兼CEO刘威博士认为,大语言模型的终局是服务数字世界的coding agent,而世界模型的终局是服务物理世界的simulation agent。当模型能够模拟物理世界,下一步就是让智能体学会在其中行动。Olympus的服务对象因此清晰展开:在数字世界中,它面向游戏智能体,让虚拟角色可被理解和驱动;在物理世界中,它指向机器人、具身智能、L5级自动驾驶和工业仿真等需要与真实世界互动的智能系统。这些系统都需要先解决一个问题——AI如何真正理解物理世界。这正是世界模型被视为通往现实世界AI关键路径的原因:它要打造的是一个能够理解、记忆、交互、推理、规划并作用于真实物理世界的底层引擎,而非为某一行业定制的工具。










