南洋理工大学、Riemann Dynamics与惠灵顿学院联合发布了一项关于AI视频生成技术的新研究,其成果以预印本形式公开于学术平台,编号为arXiv:2607.26811。该研究聚焦于实时视频生成领域的知识蒸馏技术,提出了一种名为DistillAlign的优化方案,旨在解决传统方法中模型质量与生成速度难以兼顾的矛盾。
当前主流的高质量视频生成模型多采用双向扩散机制,这类模型在生成过程中可自由参考任意时刻的信息,如同画家创作时能随时调整整幅画布的细节。尽管这种模式能产出精细的动态画面,但其计算成本高昂,难以实现实时输出。为此,研究人员尝试将双向模型“蒸馏”为单向自回归模型——这种模型仅能逐帧生成内容且无法回溯修改,但生成速度显著提升,是构建实时交互系统的关键技术。
研究团队在实验中发现了一个反直觉现象:在蒸馏流程中,使用参数量较小的模型作为部分阶段的“教师”,反而能培养出表现更优的“学生”模型。这一发现颠覆了“教师模型越强、学生表现越好”的传统认知。通过系统性的交叉实验,研究人员证实,当蒸馏流程的初始化阶段与精炼阶段使用同一套数据分布时,最终效果显著优于混合使用不同数据的情况。例如,用140亿参数模型的初始化数据搭配13亿参数模型的精炼目标,其效果优于反向组合,尽管后者在单个阶段使用了更高参数的模型。
传统评估体系主要依赖视觉评分工具(如VBench),但这类指标无法捕捉模型在分布覆盖上的差异。为此,研究团队设计了“教师归一化分布评估协议”,通过统一的重噪声处理与特征空间映射,量化学生模型对教师模型分布的覆盖程度。实验表明,某些初始化方法虽在视觉评分上表现平平,却能覆盖教师模型的更多特征区域,这种广泛覆盖为后续精炼提供了更坚实的基础。相比之下,视觉评分高但覆盖率低的模型,在精炼阶段容易陷入局部优化,导致最终多样性不足。
研究进一步揭示,即使初始化与精炼阶段的目标分布一致,过度的精炼训练仍会导致模型分布坍缩。这种现象表现为:随着训练步数增加,模型逐渐聚焦于教师模型的高概率区域,放弃对其他区域的覆盖,最终生成内容趋于单一。通过可视化特征空间分布,研究人员观察到学生模型的分布范围随训练进程不断收缩,与教师模型的边缘区域逐渐脱离。
针对上述问题,DistillAlign方案引入了联合蒸馏机制。该机制在精炼阶段同时优化两个目标:一方面通过反向KL散度最小化提升生成质量,另一方面通过一致性蒸馏损失维持对教师模型整体分布的覆盖。实验显示,当两个目标的权重系数设置为0.01时,模型在视觉评分、精确率与覆盖率三项指标上达到最佳平衡。这种设计有效防止了模型在长期训练中过度特化,确保生成内容既精细又多样。
在标准评测协议下,DistillAlign展现出显著优势。其强版本(使用140亿参数教师模型)在VBench总分上达到84.83,超越所有对比方法;弱版本(仅使用13亿参数教师模型)更以84.54分击败了所有采用更大教师模型的基准。在覆盖率指标上,DistillAlign强版本达到0.69,弱版本为0.59,而传统方法最高仅0.29。定性分析显示,DistillAlign生成的视频在物体细节、运动连贯性上表现突出,且不同随机种子下的输出场景变化更丰富,避免了传统方法常见的模板化问题。
该研究为AI视频生成领域提供了新的技术路径。通过优化蒸馏流程中的分布匹配机制,弱参数模型也能训练出高质量生成器,这对降低算力需求、推动实时视频生成技术普及具有重要意义。目前,研究团队已公开完整论文及视觉对比样本,供学术界与产业界参考验证。











