DiffusionOPSD:扩散模型中的同策略自蒸馏框架
On-Policy Self-Distillation in Diffusion Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。
来源:Hugging Face Daily Papers · arxiv.org