用于持续学习的快速权重注意力机制 Fast Weight Attention
Fast Weight Attention for Continual Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出在读写后自回归语义下推导快速权重记忆的归一化一阶更新,用于平方误差回归与负内积目标。该框架包含 Falcon-1(标量 NLMS 更新)、Falcon-2(逐列扩展)和 Falcon-3(滑动窗口小批量更新),以及对应的内积变体 Falcon-1A/2A/3A,并提供循环、掩码并行与分块并行形式及数值稳定的正衰减重归一化。代表性变体在语言建模中保持竞争力,并在变长数字加法上改善长度外推。
来源:Hugging Face Daily Papers · arxiv.org