在人工智能领域,视频生成技术正成为探索具身智能的重要突破口。然而,当前主流模型普遍采用像素级直接预测方式,在物理规律模拟的准确性与动态连贯性方面存在明显短板。针对这一技术瓶颈,科研团队近日宣布推出新型物理世界建模框架PhiZero,通过引入"物理语言"这一创新概念,为视频生成领域带来全新范式。
该模型的核心突破在于构建了物理规律显式推理机制。不同于传统模型直接生成像素的做法,PhiZero创造性地开发出离散化的物理表征语言。这套语言体系通过自监督学习机制,从海量真实视频中自动提取状态转移模式,能够精准捕捉不同场景下的动态演化规律。研究团队特别设计了"推理-渲染"双阶段架构:首先在物理语言空间进行自回归式未来推演,再由专用扩散解码器将抽象推理结果转化为高清视频。这种解耦设计使物理规律模拟与视觉渲染分离,显著提升了生成内容的物理合理性。
技术实现层面,系统包含两大核心模块。物理语言分词器采用转移级Q-Former架构,通过捕捉相邻帧间的状态变化,配合有限标量量化技术生成紧凑的离散符号序列。扩散解码器则以首帧图像和物理符号为条件,运用渐进式生成策略恢复出具有丰富细节的视觉内容。物理推理器基于预训练视觉语言模型构建,通过融合首帧视觉信息与文本动作指令,实现未来物理符号序列的精准预测。
在权威基准测试中,PhiZero展现出卓越性能。该模型在Physics-IQ Verified、PhyGround等物理推理评估集上取得突破性进展,在WorldModelBench视频生成测试中同样表现优异。实验数据显示,模型能够准确模拟碰撞导致的物体运动轨迹、重力作用下的形变过程,以及复杂连锁反应等动态场景。特别是在需要长程推理的任务中,其生成的物理轨迹与真实世界高度吻合。
这项突破为具身智能发展提供了关键技术支撑。相比传统视频生成方法,PhiZero构建的物理世界模型具有更强的可控性和交互性。其离散化的物理表征体系不仅便于人类理解与干预,更为机器人运动规划、数字孪生等应用场景开辟了新路径。随着技术持续优化,该模型有望在工业仿真、自动驾驶训练等领域发挥重要作用。











