跳到正文
Hugging Face Daily Papers·· 27 天前AI 评分42

NeoHorse-1:通过带路由 Harness 的智能体后训练迈向递归自我改进

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

NeoHorse-1 是面向递归自我改进(RSI)的智能体原生模型系列,通过异构模型池与智能路由记录每轮能力需求、服务层级和交互,并转化为保留交错推理、工具调用与 harness 上下文的训练样本。在覆盖 harness 智能体、工具使用、编程和指令遵循的 11 项基准上,后训练将 4B 模型宏平均从 58.94 提升至 64.87,9B 从 65.60 提升至 69.04。

来源:Hugging Face Daily Papers · arxiv.org