Thinking Machines Lab 提出在线策略蒸馏方法,用更少算力复现 RL 后训练效果
On-Policy Distillation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。
推荐理由
Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。
来源:Thinking Machines Lab Blog · thinkingmachines.ai