亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理后训练效果反而更好
删掉99.95%训练信号,效果反而更好!极端稀疏监督刷新大模型后训练逻辑
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
亚马逊与杜克大学团队发现,在On-Policy Distillation中每条数千token的推理轨迹只随机训练一个token(约0.05%),仍能稳定提升Qwen3数学推理能力,甚至反超全token训练。在9组teacher–student配置及Llama、coding reasoning、PPO-based RLVR中均观察到类似现象,且部分稀疏OPD模型性能超过教师模型本身。
来源:量子位 · 微信公众号 · mp.weixin.qq.com