跳到正文
ByteDance Seed Papers· Mingze Wang, Shuchen Zhu, Yuxin Fang, Binghui Li, Kai Shen, Shu Zhong·· 2026-05-26AI 评分43

LLM 中的缩放向量研究:微小参数如何显著影响预训练

Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对大语言模型中归一化层的可学习缩放向量,研究从表达力、优化和架构结构三方面展开系统分析,发现其虽仅占极小参数比例,移除后却会显著损害 LLM 预训练。理论表明在 Pre-Norm 架构中缩放向量并不提升表达力,而是通过对后续线性映射的自增强预条件效应改善优化,且权重衰减对 Input-Norm 层有益、对 Output-Norm 层有害。

来源:ByteDance Seed Papers · arxiv.org