LOOM:可扩展的循环 MoE 训练方案,支持 9-12 次循环
Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 LOOM,通过缩放残差更新、每轮重注入输入嵌入及逐循环路由器,解决循环 MoE 的深度诅咒与专家选择坍缩问题,实现 100M-1.7B 模型稳定扩展至 9-12 次循环。
来源:Hugging Face Daily Papers · arxiv.org