跳到正文
Hugging Face Daily Papers·· 2026-09-04AI 评分46

重新思考大语言模型的 On-Policy 蒸馏 II:单个训练样本

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究发现,单条 query 的 one-shot OPD 训练可持续数百步提升,并恢复全量数据 OPD 的大部分收益。单条 query 的状态覆盖率达 71.5%,16 条语义不同的 query 可达 98.9% 并追平全量训练。OPD 因此是数据过饱和但算法受限,学生模型吸收监督的速度才是瓶颈。

来源:Hugging Face Daily Papers · arxiv.org