研究揭示 on-policy 参数更新方向是 LLM 后训练泛化的关键,提出 OPSFT 方法
On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现 on-policy 后训练持续调整参数更新方向,而 SFT 沿固定方向更新,据此提出 OPSFT(On-Policy direction-constrained Supervised Fine-Tuning),将 SFT 更新约束到 on-policy 范式识别出的方向。
来源:Hugging Face Daily Papers · arxiv.org