跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分40

OASIS:突破 LLM 推理中同策略自蒸馏的扩展限制

Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 OASIS,保留同策略自蒸馏(OPSD)目标,但主要监督经标签验证的同策略轨迹,并用模型自身未验证的尝试替代书面解答作为教师上下文,因此仅需最终答案标签。

来源:Hugging Face Daily Papers · arxiv.org