IQuest 研究:MuonH 早期收敛快不等于最终效果好,学习率调度决定 Hyperball 优化器上限
IQuest给出大规模预训练新视角:早期收敛快不等于最终效果好,调度策略决定MuonH上限
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
至知创新研究院(IQuest Research)与合作伙伴拆解了 Hyperball 优化器 MuonH 的训练动态,发现其优势主要来自隐式形成的角有效学习率调度,而非更优的更新方向。
来源:量子位 · 微信公众号 · mp.weixin.qq.com