跳到正文
原文
Hugging Face Daily Papers·· 5 天前AI 评分46

在线策略还是离线策略学习?知识蒸馏动态的系统性研究

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

AI 导读

一项在 Llama3 和 Qwen2.5 模型家族上开展的强到弱知识蒸馏研究显示,rollout 策略并非蒸馏动态的核心因素:token 级 KL 方向更明显地影响任务表现与输出覆盖,学习率则决定遗忘程度与更新稀疏性。

来源:Hugging Face Daily Papers · arxiv.org