跳到正文
Hugging Face Daily Papers·· 2026-08-17AI 评分36

LOPD:让教师特权上下文可端到端学习的潜在在线策略自蒸馏

Latent On-Policy Self-Distillation

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 Latent On-Policy Self-Distillation(LOPD),将自教师的特权上下文本身变为可端到端学习的连续 latent token,而非依赖人工指定的答案、反馈或技能。

来源:Hugging Face Daily Papers · arxiv.org