研究揭示基础模型可借起始 token 提示激发推理能力
Base Models Can Reason By Taking a Cue From Training Data
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
论文研究训练数据如何在基础模型响应的起始 token 与后续推理行为之间建立关联。固定特定起始 token 提示即可让基础模型在数学和编码上逼近 RL 训练版本:".\n\nOkay" 将 Olmo-3-7B 的 MATH-500 pass@1 准确率从 42% 提升到 78%,"Alright," 将 Qwen3-14B 从 72% 提升到 87%。
来源:Hugging Face Daily Papers · arxiv.org