通过递归自改写(RSR)扩展复杂任务轨迹:Qwen-3.8-27B 在 Terminal-Bench 2 上 pass@3 从 57.0% 提升至 74.2%
Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 Recursive Self-Rewrite(RSR)框架,用 Qwen-3.8-27B 在多种 harness 下发现成功解法,并重建为通用 harness 下的训练轨迹。
来源:Hugging Face Daily Papers · arxiv.org