在注意力机制中用量化 Softmax 预训练 Transformer
Pretraining Transformers with Quantized Softmax in Attention
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究用 K-interval attention 近似指数函数,在注意力机制中引入量化 Softmax 并推导对应反向传播规则。在 124M 参数、2.5B 训练 token 下,K=4 时固定窗口校准配合归一化后代理的验证损失比 Softmax 高 +0.019 nats,K=16 配合归一化前代理仅高 +0.004 nats。分离行极值不改变前向计算,但会导致验证损失延迟上升。
来源:Hugging Face Daily Papers · arxiv.org