超越最终分数:面向长周期 AI 研发的智能体系统评估
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一篇 arXiv 论文提出新的评估框架,对七个前沿模型在 36 项长周期任务上的表现做系统评测,用规则化指标从方案构建、执行与反馈控制刻画单次运行行为,并通过受控对比考察任务内与跨任务的经验复用。
来源:Hugging Face Daily Papers · arxiv.org