Self-OPD:无需教师模型的流匹配模型同策略蒸馏
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Self-OPD 提出一种无需教师模型的流匹配模型同策略蒸馏框架,将学生模型自身的探索转化为逐步监督信号。该方法在每个时间步将确定性下一状态预测分支为 K 个随机 SDE 候选,用 ODE 采样器展开并与确定性自参考基线比较奖励,得到归一化优势,再以全分支 pull-push 目标优化速度场。在单一与混合奖励基准上,Self-OPD 无需任务专用教师即优于此前的 RL 与 OPD 方法。
来源:Hugging Face Daily Papers · arxiv.org