跳到正文
原文
Hugging Face Daily Papers·· 7 天前AI 评分35

RWTD:用奖励加权传输蒸馏对齐一步生成模型

Aligning One-Step Generative Models with Reward-Weighted Transport Distillation

AI 导读

研究提出奖励加权传输蒸馏(RWTD),一种仅需生成样本和标量奖励评估的一步生成模型后训练方法,通过混合当前与参考分布的自适应目标,经特征空间最优传输与不动点回归实现。该方法将一步 SANA Sprint 1.6B 的 GenEval 分数从 0.73 提升至 0.80,偏好对齐实验显示其具备跨奖励泛化能力,能兼顾改进与组合能力保留。

来源:Hugging Face Daily Papers · arxiv.org