MiniMax 拆解 M2 无法说出“马嘉祺”的原因:SFT 导致稀疏 token 的 lm_head 漂移
Why Can't the MiniMax LLM Say "Ma Jiaqi"? Internal Investigation of Sparse Token Forgetting
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MiniMax 内部调查确认,MiniMax M2 无法生成“嘉祺”等低频 token 的根因是 SFT 数据覆盖不均导致 lm_head 表示漂移,输入侧 embedding 几乎不变故理解能力保留。调查还发现日语 token 严重退化与小语种混杂同源,加入全词表覆盖合成数据后,日俄混杂率从 47% 降至 1%,定向测试通过率从 4/16 升至 13/16。
推荐理由
原文以模型方一手实验定位稀疏 token 遗忘的 lm_head 漂移机制,并给出可复用的全词表覆盖修复数据方案。
来源:MiniMax Blog · minimax.io