AutoDataBench:智能体能否写出驱动自我改进循环的数据?
AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
针对数据生产依赖人工、现有评测只看训练后效果的问题,研究者提出 AutoDataBench,要求智能体根据原始基准任务和模型尝试记录,写出在有效性、新颖性、难度和行为覆盖上符合数据管线验收标准的新任务。在三个可执行智能体任务基准上,默认 45 分钟预算内没有智能体得分超过 20 分(满分 100);给最强智能体四倍时间后得分大幅提升,而单个可用任务的成本几乎不变。
来源:Hugging Face Daily Papers · arxiv.org