跳到正文
Thinking Machines Lab Blog·· 2025-10-27精选AI 评分67

Thinking Machines Lab 提出在线策略蒸馏方法,用更少算力复现 RL 后训练效果

On-Policy Distillation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。

推荐理由

Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。

来源:Thinking Machines Lab Blog · thinkingmachines.ai