Hugging Face Daily Papers·· 7 天前AI 评分35
RWTD:用奖励加权传输蒸馏对齐一步生成模型
Aligning One-Step Generative Models with Reward-Weighted Transport Distillation
AI 导读
研究提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过混合当前与参考分布的自适应目标,经特征空间最优传输与不动点回归实现。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,偏好对齐实验显示其具备跨奖励泛化能力,能兼顾改进与组合能力保留。
来源:Hugging Face Daily Papers · arxiv.org