Hugging Face Daily Papers·· 5 天前AI 评分46
在线策略还是离线策略学习?知识蒸馏动态的系统性研究
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
AI 导读
一项在 Llama3 和 Qwen2.5 模型家族上开展的强到弱知识蒸馏研究显示,rollout 策略并非蒸馏动态的核心因素:token 级 KL 方向更明显地影响任务表现与输出覆盖,学习率则决定遗忘程度与更新稀疏性。
来源:Hugging Face Daily Papers · arxiv.org