LOPD:让教师特权上下文可端到端学习的潜在在线策略自蒸馏
Latent On-Policy Self-Distillation
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Latent On-Policy Self-Distillation(LOPD),将自教师的特权上下文本身变为可端到端学习的连续 latent token,而非依赖人工指定的答案、反馈或技能。
来源:Hugging Face Daily Papers · arxiv.org
Latent On-Policy Self-Distillation
本站未展示全文,请前往来源网站阅读。
研究者提出 Latent On-Policy Self-Distillation(LOPD),将自教师的特权上下文本身变为可端到端学习的连续 latent token,而非依赖人工指定的答案、反馈或技能。
来源:Hugging Face Daily Papers · arxiv.org