ITBear旗下自媒体矩阵:

港中文等多校联合研发VideoCoCo:为AI视频生成注入物理“灵魂”

   时间:2026-08-08 00:48:39 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当用户输入“一块黄油在热锅里慢慢融化”,现有的AI视频生成模型往往只能输出画面精美但物理逻辑混乱的内容——黄油可能保持固态,或突然变成液体,甚至出现违背热力学规律的奇异形态。这种“视觉正确但物理错误”的现象,正成为制约AI视频生成技术走向实用化的关键瓶颈。近日,一支由香港中文大学、中国科学技术大学等十余所顶尖高校组成的联合研究团队,提出了一种名为VideoCoCo的创新框架,通过引入可执行的程序代码作为中间推理载体,成功将视频的物理一致性得分提升至行业领先水平。

研究团队指出,当前主流模型面临的核心矛盾在于“因果不透明性”:用户指令仅描述“发生了什么”,却无法说明“如何发生”。例如,“玻璃球坠地”的指令中,既未指定材质密度,也未定义碰撞参数,模型只能依赖训练数据中的视觉先验进行猜测。这种模糊性导致37%的生成视频存在明显物理错误,在材料动力学场景(如干冰升华)中错误率更高达62%。此前学界尝试的“预规划”“测试时搜索”等方案,虽能部分改善问题,但始终未能突破“描述性辅助”的局限,如同仅提供地图却未配备导航工具。

VideoCoCo的突破性在于构建了“双引擎协同”系统。其核心是让AI先编写可执行的Blender程序,而非直接生成视频。当用户输入描述后,系统会调用代码智能体将其转化为精确的物理仿真脚本——这段代码不仅定义了物体属性(如黄油的熔点、锅的导热系数),更通过时间轴标注了关键状态变化(第15帧开始软化、第42帧出现气泡)。在沙盒环境中运行程序后,生成的“白模视频”虽仅有灰色轮廓,却完整记录了从初始状态到最终结果的每帧物理演变,形成可验证的“时空草稿”。

为解决白模与真实视频的域差距问题,研究团队专门构建了VideoCoCo-3K数据集。该数据集包含3000组“草稿-指令-目标”对应样本,通过自动化流程生成:先运行双引擎系统获得白模,再由商业模型Seedance 2.0生成高质量目标视频,最终形成涵盖力学、热力学等四大物理维度的训练样本。实验表明,采用LoRA轻量化微调策略的视频编辑模型,在给定白模和外观指令的条件下,能精准还原目标视频的运动结构,同时保持画面质感。这种“物理过程由代码保证、视觉呈现由模型优化”的分工模式,使模型无需重新学习运动规律,只需专注材质渲染与光影处理。

在PhyGenBench和VBench-2.0两大物理一致性基准测试中,接入VideoCoCo的基础模型OmniWeaving展现显著优势。PhyGenBench测试显示,其平均分从0.475跃升至0.558,超越Pika、Gen-3等商业系统,尤其在材料动力学(提升0.133分)和热力学(提升0.078分)场景表现突出。VBench-2.0测试中,物理合理性百分比从52.18%提升至77.88%,力学维度得分高达92.31%。消融实验进一步验证,即使未经训练的模型仅使用白模草稿,物理得分仍能提升6.5%,证明代码推理是提升物理一致性的核心因素。

从定性对比看,VideoCoCo的优势更为直观。在“真空瓶压缩”场景中,传统模型生成的瓶子仅轻微变形,而VideoCoCo版本准确呈现了气压差导致的向内凹陷;处理“鸡蛋撞石”时,其版本完整展现了蛋壳碎裂、蛋液飞溅的冲击过程,而对比模型的结果则缺乏动态细节。研究团队强调,这种提升源于代码的三大特性:显式性要求每个物理参数必须明确定义,可执行性确保过程真实可运行,可检查性允许人类专家验证推理逻辑。

尽管取得突破,该方案仍存在局限性。当前流程因包含代码生成与渲染步骤,推理延迟较直接生成模型增加约40%。Blender仿真器的能力边界限制了可处理场景——对复杂流体运动或化学反应的建模仍存在挑战。研究团队正探索接入太极Taichi等专业物理引擎,以扩展可模拟的物理现象范围。长远来看,他们希望通过知识蒸馏技术,将可执行先验直接融入端到端模型,最终实现“零仿真步骤”的物理正确视频生成。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version