腾讯混元ACL 2026论文拆解SFT训练中15.3%的不完全学习样本
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
腾讯混元团队与UNSW在ACL 2026主会长文提出SFT的不完全学习现象(ILP),在Qwen、LLaMA、OLMo2等模型家族(1.8B–14B)和10个数据集上平均有15.3%的样本在训练中见过、loss也收敛,但重测仍答不对。
来源:量子位 · 微信公众号 · mp.weixin.qq.com