跳到正文
量子位 · 微信公众号·· 2026-08-06AI 评分44

IQuest 研究:MuonH 早期收敛快不等于最终效果好,学习率调度决定 Hyperball 优化器上限

IQuest给出大规模预训练新视角:早期收敛快不等于最终效果好,调度策略决定MuonH上限

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

至知创新研究院(IQuest Research)与合作伙伴拆解了 Hyperball 优化器 MuonH 的训练动态,发现其优势主要来自隐式形成的角有效学习率调度,而非更优的更新方向。

来源:量子位 · 微信公众号 · mp.weixin.qq.com