跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分44

研究揭示 On-Policy Distillation 机制:学生模型只是重加权已有特征,而非学习新特征

Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究用 sparse crosscoders 分析 LLM 推理中的 On-policy Distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身的特征,学生模型 98% 以上高频使用特征的激活率变化在 20% 以内。SFT 预热会提前完成部分 OPD 的特征重加权,并额外改变对话格式、推理风格和数学符号相关特征,这些改变会贯穿 OPD 全程。

来源:Hugging Face Daily Papers · arxiv.org