中国科学院自动化研究所国家模式识别实验室主导完成了一项突破性研究,其成果以预印本形式发布于arXiv平台,编号为arXiv:2607.28624。这项名为PhiZero的研究提出了一种全新框架,通过构建“物理语言”系统,使人工智能首次具备理解并模拟物理世界变化规律的能力。该系统在视频生成与理解任务中展现出超越主流商业模型的性能,为开发具备物理直觉的通用人工智能开辟了新路径。
传统视频生成模型虽能生成逼真画面,却存在根本性缺陷:它们仅掌握像素层面的视觉规律,无法理解物理交互的本质。例如在模拟“网球击中橡皮鸭”场景时,模型可能生成流畅画面,但被击中的橡皮鸭会静止不动。研究团队指出,人类婴儿通过观察积累的物理直觉,本质上是将物理规律抽象为语言符号进行推理的能力——这种能力正是现有AI系统所缺失的。
PhiZero的核心创新在于构建了介于自然语言与像素之间的“物理语言”中间层。该系统将视频压缩为由25000个离散符号组成的序列,每个符号代表特定类型的物理变化模式。以4秒视频为例,其物理变化过程会被编码为256个符号的精简摘要。这种表示方式既保留了碰撞、流动等关键物理信息,又剥离了颜色、纹理等视觉细节,使模型能专注于运动规律本身。
系统采用“先推理后渲染”的双阶段架构:物理推理模块基于初始画面和用户指令,在符号空间中预测未来变化序列;视频生成模块则根据符号序列与首帧画面,渲染出符合物理规律的动态视频。这种解耦设计使物理规律学习与视觉细节生成相互独立,避免了传统模型中物理逻辑与视觉表现混杂导致的错误。例如在倒酒场景中,系统能准确模拟液体流动轨迹,即使更换容器形状后仍能保持物理合理性。
研究团队构建了包含500万段4秒视频的庞大训练集,涵盖真实场景与物理仿真数据。通过渐进式训练策略,模型先学习短时局部变化,再逐步掌握长时间跨度的物理演化。实验表明,PhiZero在Physics-IQ Verified等三个物理真实性基准测试中均获最高分,超越Sora 2等商业模型。在视频理解任务中,其区分物理合理场景的准确率达56.34%,显著优于GPT-4o等大型多模态模型。
物理语言的独特优势在跨场景迁移任务中得到充分验证。研究人员将人体运动视频编码为物理符号后,仅需替换首帧图像中的角色,即可生成机器人执行相同动作的视频,整个过程无需人机配对训练数据。在自动驾驶仿真中,系统能根据车辆轨迹数字描述,生成包含精确转向动作的驾驶视频,连“轻微右转”与“急速右转”的差异都能细致呈现。
消融实验揭示了关键设计的作用:移除预训练扩散解码器导致重建质量下降23%,证明其对于从紧凑符号恢复视觉细节至关重要;取消相邻帧变化建模使性能下滑17%,验证了局部过渡建模的必要性。物理语言的语义结构分析显示,自动驾驶场景中不同转向动作在特征空间形成连续弧形分布,机器人操作动作则聚类为四个独立簇,印证了系统对物理规律的自发理解。
尽管当前物理符号尚未直接对应人类可解释的物理变量,且对触觉交互等不可见过程覆盖有限,但研究团队认为该框架具有显著扩展潜力。通过引入更大模型与更丰富数据,物理语言有望成为连接视觉感知与物理推理的桥梁,为机器人技能迁移、自动驾驶仿真等领域提供全新解决方案。项目主页Phi-Zero.github.io已公开技术细节与演示视频,供研究者深入探索。











