跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分38

重新思考跨分词器在线策略蒸馏:从对齐覆盖率到监督可靠性

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究发现在数学推理和代码生成任务上,跨分词器在线策略蒸馏(OPD)中严格 1:1 对齐已覆盖大部分学生生成 token,将反向 KL 限制在学生所选共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率,并优于所评估的跨分词器基线。

来源:Hugging Face Daily Papers · arxiv.org