跳到正文
Hugging Face Daily Papers·· 7 天前AI 评分49

AutoDataBench:智能体能否写出驱动自我改进循环的数据?

AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

针对数据生产依赖人工、现有评测只看训练后效果的问题,研究者提出 AutoDataBench,要求智能体根据原始基准任务和模型尝试记录,写出在有效性、新颖性、难度和行为覆盖上符合数据管线验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20 分(满分 100);给最强智能体四倍时间后得分大幅提升,而单个可用任务的成本几乎不变。

来源:Hugging Face Daily Papers · arxiv.org