重新思考大语言模型的 On-Policy 蒸馏 II:单个训练样本
Rethinking On-Policy Distillation of Large Language Models II: One Training Example
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现,单条 query 的 one-shot OPD 训练可持续数百步提升,并恢复全量数据 OPD 的大部分收益。单条 query 的状态覆盖率达 71.5%,16 条语义不同的 query 可达 98.9% 并追平全量训练。OPD 因此是数据过饱和但算法受限,学生模型吸收监督的速度才是瓶颈。
来源:Hugging Face Daily Papers · arxiv.org