OASIS:突破 LLM 推理中同策略自蒸馏的扩展限制
Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 OASIS,保留同策略自蒸馏(OPSD)目标,但主要监督经标签验证的同策略轨迹,并用模型自身未验证的尝试替代书面解答作为教师上下文,因此仅需最终答案标签。
来源:Hugging Face Daily Papers · arxiv.org