跳到正文
量子位 · 微信公众号·· 2026-07-25AI 评分55

腾讯混元ACL 2026论文拆解SFT训练中15.3%的不完全学习样本

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

腾讯混元团队与UNSW在ACL 2026主会长文提出SFT的不完全学习现象(ILP),在Qwen、LLaMA、OLMo2等模型家族(1.8B–14B)和10个数据集上平均有15.3%的样本在训练中见过、loss也收敛,但重测仍答不对。

来源:量子位 · 微信公众号 · mp.weixin.qq.com