跳到正文
Hugging Face Daily Papers·· 26 天前AI 评分40

协同演化 Harness 与模型:On-Policy 修正让弱模型在模仿失效处追赶

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对 agent harness 与模型权重共同决定行为的问题,研究在七项企业 agent 任务上先为较弱模型演化 harness,再用更强专家监督。但让弱模型模仿专家完整轨迹会导致 Qwen3-Coder 和 Gemma 4 在全部七项任务上回退 4 至 30 分,原因是模仿破坏了模型与 harness 的匹配。

来源:Hugging Face Daily Papers · arxiv.org