重新思考跨分词器在线策略蒸馏:从对齐覆盖率到监督可靠性
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究发现在数学推理和代码生成任务上,跨分词器在线策略蒸馏(OPD)中严格 1:1 对齐已覆盖大部分学生生成 token,将反向 KL 限制在学生所选共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率,并优于所评估的跨分词器基线。
来源:Hugging Face Daily Papers · arxiv.org