跳到正文
Hugging Face Daily Papers·· 2026-08-17AI 评分54

超越最终分数:面向长周期 AI 研发的智能体系统评估

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一篇 arXiv 论文提出新的评估框架,对七个前沿模型在 36 项长周期任务上的表现做系统评测,用规则化指标从方案构建、执行与反馈控制刻画单次运行行为,并通过受控对比考察任务内与跨任务的经验复用。

来源:Hugging Face Daily Papers · arxiv.org