ITBear旗下自媒体矩阵:

ICML 2026 | 蒸馏模型化身采样引擎,Diffusion RL训练效率大幅提升

   时间:2026-08-03 02:22:35 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

在图像与视频生成领域,扩散模型凭借其强大的生成能力已成为关键技术底座。然而,当研究者尝试利用在线强化学习进一步提升生成内容的审美质量、文本一致性及综合表现时,训练成本却成为难以逾越的障碍。每次策略推演(policy rollout)需完成大量去噪步骤,在线采样过程消耗了大量训练时间,严重制约了模型的迭代效率。

直接减少采样步数虽能降低计算成本,但会导致样本质量显著下降。若将采样步数从50步骤减至10步,生成的样本质量将无法满足奖励模型的评估要求,进而导致策略更新偏离高质量分布。如何在保证样本质量的前提下降低采样成本,成为亟待解决的核心问题。

该框架采用双阶段交替训练机制:在强化学习阶段,冻结蒸馏采样器参数,利用其快速生成样本供奖励模型评估,进而更新策略模型;在蒸馏阶段,以更新后的策略模型为教师模型,对蒸馏采样器进行重新蒸馏,确保其分布与当前策略保持一致。通过轨迹分布匹配与奖励感知蒸馏技术,既保证了基础分布对齐,又保留了高奖励样本的生成能力。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version