由中国科学院自动化研究所联合香港中文大学、上海人工智能实验室、高德地图及清华大学共同完成的一项研究,近日以预印本形式在arXiv平台发布,论文编号为arXiv:2608.02603。该研究针对当前AI视频生成模型评测体系的局限性,提出了一套名为WorldExam的评测基准,首次将"世界反应性"作为核心评价指标,系统评估AI生成视频中场景对角色行为的动态响应能力。
传统评测体系主要关注画面质量与指令执行精度,例如角色是否按指定路径移动、画面是否存在明显瑕疵等。但研究团队指出,这类指标无法回答一个根本性问题:AI生成的虚拟世界是否具备物理合理性?例如,当角色走向楼梯时,其脚步是否会随台阶高度变化?碰撞物体后,目标是否会产生符合物理规律的反应?这些涉及环境交互的深层能力,正是现有评测框架的盲区。
WorldExam构建了包含1474道测试题的分层评测体系,覆盖视觉质量、控制遵从性、空间一致性与世界反应性四个层级。其中,世界反应性作为最高层级,通过地形交互、物体交互、社会交互、物理反应和目标完成五项任务,检验模型在未明确告知环境响应规则时的自主推理能力。例如,在地形交互任务中,模型需仅凭"向前走"的指令,自动调整角色在楼梯、斜坡等复杂地形上的运动姿态;在社会交互任务中,背景行人需对靠近的角色做出合理避让或停步反应。
研究团队将现有视频生成模型分为摄像机驱动、动作驱动和语言驱动三类,并设计统一评测框架。摄像机驱动型模型通过预设摄像机轨迹生成视频,动作驱动型模型接收类似游戏操作指令控制角色,语言驱动型模型则直接解析自然语言描述。三类模型在评测中展现出显著差异:摄像机驱动型在空间记忆任务中表现优异,但无法处理角色动作;动作驱动型能精确执行运动指令,却常忽视环境反馈;语言驱动型在交互任务中得分最高,但运动控制精度较低。
评测结果显示,20个代表性模型在世界反应性任务中普遍表现薄弱。例如,在地形交互任务中,动作驱动型模型平均得分不足30分,而语言驱动型模型得分超过60分;但在摄像机控制任务中,动作驱动型模型得分普遍低于摄像机驱动型模型30个百分点以上。这种分化表明,现有模型尚未形成对虚拟世界的完整理解,更多停留在"画面生成"而非"场景模拟"层面。
为确保评测客观性,研究团队创新性地采用多模态评分机制。对于几何相关任务,通过VGGT-Ω模型重建视频三维场景,计算摄像机轨迹误差或主体运动与地形的高度匹配度;对于语义交互任务,则训练GPT-5.5作为AI裁判,对照预设核查清单逐帧判断环境响应合理性。人工验证实验显示,AI评分与人类判断的相关系数超过0.85,证明该评分体系具有高可靠性。
具体案例分析进一步揭示模型能力边界。在物体交互任务中,某语言驱动型模型能准确推动可移动门,但对固定墙体仍尝试穿越;在社会交互任务中,多数模型生成的行人会与主角重叠行走,而非主动避让。这些失误表明,模型尚未建立"物体物理属性"与"行为约束条件"之间的关联记忆,其世界模型仍停留在碎片化阶段。
研究团队强调,视觉质量与世界反应性不存在必然关联。实验数据显示,7个语言驱动型模型的视觉质量得分集中在79.6至81.0分区间,但任务综合分跨度达25分。这意味着,画面精美度无法反映模型对物理规则的理解程度,过度优化视觉表现可能偏离世界模拟的核心目标。
该研究通过系统化评测框架,首次量化呈现了不同类型视频生成模型的能力图谱。其提出的"世界反应性"指标,为后续模型优化提供了明确方向:摄像机驱动型需拓展角色控制接口,动作驱动型需强化环境感知模块,语言驱动型则需提升运动指令解析精度。这一发现或将推动AI视频生成领域从"画面逼真"向"场景可信"的范式转变。











