研究发现 Transformer 过早停止思考,一个微型 LoRA 可修复
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
arXiv 论文发现预训练 Transformer 只用极少深度跟随上下文引用,13 个基础模型仅能可靠跟随 1.4-3.6 行。在单层早期插入 rank-8 LoRA 并冻结全部原权重,可将 Qwen3-8B 在 24 行链上的精确匹配率从 15.5% 提升到 99%,更长训练的 LoRA 达到 50 行,Ouro-1.4B 在八次循环后至少 160 行。
来源:Hugging Face Daily Papers · arxiv.org