协同演化 Harness 与模型:On-Policy 修正让弱模型在模仿失效处追赶
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对 agent harness 与模型权重共同决定行为的问题,研究在七项企业 agent 任务上先为较弱模型演化 harness,再用更强专家监督。但让弱模型模仿专家完整轨迹会导致 Qwen3-Coder 和 Gemma 4 在全部七项任务上回退 4 至 30 分,原因是模仿破坏了模型与 harness 的匹配。
来源:Hugging Face Daily Papers · arxiv.org