用 On-Policy Reverse Distillation 激发弱到强泛化
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 On-Policy Reverse Distillation(OPRD),通过在学生的 rollout 上评估教师相对参考策略的策略偏移,并沿该方向放大由 verifier 驱动的策略梯度分量,从而在保留策略优化驻点的同时加速学习、超越教师。
来源:Hugging Face Daily Papers · arxiv.org