热点事件观察中
提出长度自蒸馏方法缓解RL后训练的长度缩放税
1 篇报道1 个报道来源3 天前更新
先了解这件事
AI 综述
2026年9月30日,Hugging Face Daily Papers 报道了一项针对 RL 后训练中“长度扩展税”(LST)的研究。该问题指模型在 RL 后训练后,对已解出问题的回复变得冗长。研究者提出 Length Self-Distillation(LSD)方法:将已解出的提示词路由到 on-policy 蒸馏,未解出的提示词仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需依赖外部模型。报道未给出实验数据、对比基线或具体效果指标,也未提及该方法在哪些模型或任务上验证。
AI 根据报道生成 · 10 小时前更新
最新进展9月30日 08:00
研究者提出 Length Self-Distillation,用在线蒸馏缓解 RL 后训练的长度扩展税。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- Hugging Face Daily Papers用在线蒸馏缓解长度扩展税:Length Self-Distillation 方法
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。