跳到正文
Hugging Face Daily Papers·· 29 天前AI 评分49

别丢掉 Dropout:为高效 LLM 训练与推理优化层稀疏性

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究显示,在最优层分布、时间调度和优化器超参数下,层 dropout 能在相同训练 FLOPs 下带来更低损失,或在相同训练步数下节省最多 25% 训练 FLOPs。

来源:Hugging Face Daily Papers · arxiv.org