逐步扩展:面向大规模 MoE 的计算高效超参数迁移方法
Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出两步超参数迁移框架,为大规模 MoE 模型估算最优学习率:先为采用 MLA 和 Muon 优化器的 MoE 适配 μP,使最优学习率在宽度缩放模型间稳定迁移;再沿 token 维度建立预测性缩放律,用小型代理模型线性回归外推到 10 万亿 token 训练规模,R² 达 0.95。
来源:Hugging Face Daily Papers · arxiv.org