跳到正文
热点事件观察中

提出长度自蒸馏方法缓解RL后训练的长度缩放税

1 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

2026年9月30日,Hugging Face Daily Papers 报道了一项针对 RL 后训练中“长度扩展税”(LST)的研究。该问题指模型在 RL 后训练后,对已解出问题的回复变得冗长。研究者提出 Length Self-Distillation(LSD)方法:将已解出的提示词路由到 on-policy 蒸馏,未解出的提示词仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需依赖外部模型。报道未给出实验数据、对比基线或具体效果指标,也未提及该方法在哪些模型或任务上验证。

AI 根据报道生成 · 10 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. Hugging Face Daily Papers
    用在线蒸馏缓解长度扩展税:Length Self-Distillation 方法

    针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。