研究揭示 On-Policy Distillation 机制:学生模型只是重加权已有特征,而非学习新特征
Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究用 sparse crosscoders 分析 LLM 推理中的 On-policy Distillation(OPD),发现 OPD 既不创造新特征也不传递教师模型自身的特征,学生模型 98% 以上高频使用特征的激活率变化在 20% 以内。SFT 预热会提前完成部分 OPD 的特征重加权,并额外改变对话格式、推理风格和数学符号相关特征,这些改变会贯穿 OPD 全程。
来源:Hugging Face Daily Papers · arxiv.org