长上下文混合模型机制解析:从混合注意力到混合位置编码
Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出长上下文混合模型机制分析框架,发现全注意力与滑动窗口注意力(SWA)或线性注意力(LA,如 GLA、GDN)的混合存在"跷跷板效应":LA 混合模型更受益于长上下文持续预训练,SWA 混合模型在长度外推下表现更好。
来源:Hugging Face Daily Papers · arxiv.org