在人工智能领域,生成逼真图像或视频已不再是新鲜事,但这些技术更多停留在对物理世界表象的复现。近期,MirroS团队提出了一种名为Code-as-World的创新框架,试图通过将物理世界转化为可执行代码,推动AI从“生成表象”向“理解机制”跨越。这一方法不仅为物理推理提供了新的思路,也为视觉生成和具身交互任务构建了统一的世界表征基础。
传统AI在处理物理世界时,往往依赖像素级预测或3D场景重建,但这些方法存在明显局限。像素虽能保留细节,却难以揭示物体运动的内在规律;3D模型虽能还原几何结构,却无法自动解释碰撞、摩擦等物理现象;自然语言虽能概括实体关系,却难以精确描述连续轨迹和物理参数。Code-as-World框架试图整合这些方法的优势,通过代码将物体属性、状态变化和物理规则显式表达,使世界表征既具有语义可解释性,又支持动态模拟和验证。
该框架的核心在于将物理世界拆解为三个层次:组成、演化和外观。组成部分描述物体几何结构、质量、摩擦系数等基础属性;演化部分定义物体运动状态、交互事件和时间推进规则;外观部分则涵盖相机视角、光照条件等视觉呈现参数。三者结合形成一个可运行的虚拟世界,其中任何参数都可独立修改,例如调整物体质量或相机位置后,系统能重新模拟并渲染出相应结果。这种设计使“世界编辑”从像素级操作升级为对底层机制的直接干预。
为实现这一目标,研究团队构建了一个循环验证的发现流程。系统首先从输入视频或文本中提取关键证据,如物体轨迹、空间关系或物理事件;随后智能体根据证据生成初始世界假设,并将其编译为可执行代码;通过模拟运行得到完整状态轨迹后,系统将其渲染为视频并与原始输入对比,差异反馈用于修正假设。这一过程借鉴了科学发现中的溯因推理,通过持续迭代逐步逼近能解释观测的真实机制。实验表明,该方法在物理推理基准测试中显著优于传统模型,验证了可执行世界表征的有效性。
可执行世界的价值不仅限于模拟验证,更在于为物理智能训练提供了规模化监督信号。互联网上虽存在海量运动视频,但缺乏物体尺寸、速度、加速度等精确标签。Code-as-World框架能从原始观测中恢复结构化世界信息,自动生成包含三维状态轨迹、接触事件和物理参数的训练数据。基于这些数据训练的Code-as-World-VL系列模型,在物理推理任务中展现出更强的泛化能力,证明可执行世界可作为连接感知数据与物理规律的桥梁。
研究团队进一步指出,代码只是实现结构化表征的一种形式,未来可扩展至更广义的“结构化语言”。代码擅长精确模拟可建模的物理过程,而自然语言则能承载更复杂的因果推理和科学知识。二者互补的抽象层级——代码支持精确执行,语言支持广泛理解——为继承和发展人类物理知识体系提供了可能。例如,智能体可先用代码模拟简单机械运动,再用语言推理长期气候模式,最终形成跨尺度的物理认知。
这一框架的潜在影响延伸至多个AI领域。在物理推理任务中,模型可先恢复世界状态再计算答案,而非直接从像素预测;视频生成可先推进世界状态再渲染像素,避免物体身份混淆;具身交互中,智能体可先模拟多种行动后果再选择最优策略。推理、生成与行动不再孤立,而是围绕同一世界表征展开查询、演化、渲染和干预操作。这种统一性为构建通用物理智能模型奠定了基础,使不同任务间的知识迁移成为可能。











