跳到正文
Hugging Face Daily Papers·· 2026-08-26AI 评分36

DiffusionOPSD:扩散模型中的同策略自蒸馏框架

On-Policy Self-Distillation in Diffusion Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。

来源:Hugging Face Daily Papers · arxiv.org