SimpleOPD:面向长上下文推理的 Tokenizer 无关在线策略蒸馏
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 SimpleOPD,一种 Tokenizer 无关的在线策略蒸馏(OPD)方法,将长上下文推理模型 SU-01 的证明推理能力迁移到短上下文学生模型。
来源:Hugging Face Daily Papers · arxiv.org