ASI-Bench 基准发布,用 60 项项目级任务评估 AI 自主科研能力
ASI-Bench: At the Dawn of Artificial Superintelligence
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
ASI-Bench 是面向通用科研领域的基准,包含覆盖 11 个科学领域的 60 项项目级研究任务,用于联合评估 AI 的创新探索与自主科研执行能力。该基准在同一研究项目中逐步撤去人类方法指引,测试 AI 能独立推进到何种程度;在 18 种智能体与模型配置上,平均分从完整方法指引下的 50.91 降至仅指定方法的 29.10,需自行确定方法时进一步降至 26.62。
来源:Hugging Face Daily Papers · arxiv.org