跳到正文
Hugging Face Daily Papers·· 5 天前AI 评分45

LOOM:可扩展的循环 MoE 训练方案,支持 9-12 次循环

Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究提出 LOOM,通过缩放残差更新、每轮重注入输入嵌入及逐循环路由器,解决循环 MoE 的深度诅咒与专家选择坍缩问题,实现 100M-1.7B 模型稳定扩展至 9-12 次循环。

来源:Hugging Face Daily Papers · arxiv.org