在图像与视频生成领域,扩散模型凭借其强大的生成能力已成为关键技术底座。然而,当研究者尝试利用在线强化学习进一步提升生成内容的审美质量、文本一致性及综合表现时,训练成本却成为难以逾越的障碍。每次策略推演(policy rollout)需完成大量去噪步骤,在线采样过程消耗了大量训练时间,严重制约了模型的迭代效率。
直接减少采样步数虽能降低计算成本,但会导致样本质量显著下降。若将采样步数从50步骤减至10步,生成的样本质量将无法满足奖励模型的评估要求,进而导致策略更新偏离高质量分布。如何在保证样本质量的前提下降低采样成本,成为亟待解决的核心问题。
该框架采用双阶段交替训练机制:在强化学习阶段,冻结蒸馏采样器参数,利用其快速生成样本供奖励模型评估,进而更新策略模型;在蒸馏阶段,以更新后的策略模型为教师模型,对蒸馏采样器进行重新蒸馏,确保其分布与当前策略保持一致。通过轨迹分布匹配与奖励感知蒸馏技术,既保证了基础分布对齐,又保留了高奖励样本的生成能力。











