跳到正文
Hugging Face Daily Papers·· 2026-08-17AI 评分38

SimpleOPD:面向长上下文推理的 Tokenizer 无关在线策略蒸馏

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 SimpleOPD,一种 Tokenizer 无关的在线策略蒸馏(OPD)方法,将长上下文推理模型 SU-01 的证明推理能力迁移到短上下文学生模型。

来源:Hugging Face Daily Papers · arxiv.org