UniPat AI 推出 PaperBenchX:10 个前沿 Agent 复现 93 篇论文任务多数失败
复现论文,10 个模型集体“翻车”!PaperBenchX 找到了 AI 科研的卡点
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
UniPat AI 推出 PaperBenchX 基准,让 10 个前沿 Agent 配置在真实科学软件中复现 12 个方向共 93 个已发表论文实验。70 道题没有被任何配置完全复现,GPT-6 Astra 仅 14% 任务过关,国产模型约 7%;建模和执行得分在六成以上,科学验证仅约 43%。评测含 3168 个可评分标准,采用隔离环境重跑验证,任务构建投入超 1000 小时博士级专家工作。
来源:硅星人Pro · 微信公众号 · mp.weixin.qq.com