重新审视后训练中的完整推理轨迹:部分轨迹与端点训练即可奏效
Revisiting Complete Reasoning Traces for Post-Training
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现,LLM 后训练(如 SFT)中完整推理轨迹带来的收益有限,而部分轨迹即使被大幅截断仍然有效。基于注意力的分析和受控 token 移除实验表明,中间 token 对最终推理质量贡献极小,模型可依据已知轨迹端点从内部知识推断缺失步骤。仅用端点训练还能改变推理行为,并提升基于强化学习或 on-policy 蒸馏的后训练方法效果。
来源:Hugging Face Daily Papers · arxiv.org