跳到正文

#评测/基准

今日 9 条
今天10月2日周五
  1. Hugging Face Daily Papers44

    Argo-Bench:评估数据智能体在企业级工作流中的表现

    Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。

  2. Karina34

    一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多一个小时,每个智能体能获得多少提升!

    引用Thoughtful@thoughtfullab

    PostTrainBench v1.2 is out! A few updates: 1. Cloud GPU support. You can now run the benchmark with identical settings through Harbor + Modal using our new Harbor adapter. 2. New leaderboard leaders. Fable 5.1 takes #1 at 44.6%, followed by Opus 5.5 at 43.8% and GPT-6 (Astra) at 41.9%. 3. Evaluation fixes. Removed BFCL, fixed HumanEval and remote-code scoring, added averaging across multiple seeds, and switched contamination checks to majority vote.

  3. Chubby♨️59

    作者引用 Epoch AI 的 Epoch Capabilities Index 数据:Claude Opus 5.5 以 167 分登顶,略高于 GPT-6 Astra;Claude Sonnet 5.5 大致追平 Claude Fable 5.1(165 分)。作者评论称 Anthropic 的中档模型在发布几个月内就达到旗舰水平,并表示很期待 Fable 5.5。榜单见 epoch.ai/eci。

    引用Epoch AI@EpochAIResearch

    Claude Opus 5.5 has taken the top spot on the Epoch Capabilities Index (ECI) with a score of 167, narrowly ahead of GPT-6 Astra. Claude Sonnet 5.5 has roughly matched Claude Fable 5.1 (165).

10月1日周四
9月30日周三
  1. Hugging Face Daily Papers43

    让 AI 审稿人更可信:RobustReview 基准与 SciCore 审稿模型

    研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。

9月29日周二
9月28日周一
  1. Hugging Face Daily Papers37

    Endless Exam:面向超级智能的数学构造基准,覆盖 14 类参数化问题族

    研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。

9月25日周五
9月24日周四
9月23日周三
9月22日周二
  1. elsewhere articles65

    Step 5 Preview 实测:榜单之外的真实表现与短板

    阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。

    推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。

9月21日周一
9月20日周日
9月19日周六
9月18日周五
  1. Karina56

    Epoch AI 推出 Benchmark Reviews 计划,对 AI 基准进行审计,首批覆盖 15 个基准,其中 4 个为 Verified、9 个为 Flawed、2 个信息不足暂无法评审。Karina Nguyen 转发并称此举能激励行业打造真正高质量的基准。

    引用Epoch AI@EpochAIResearch

    Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.

  2. OpenRouter Announcements80

    OpenRouter 实测20个图像生成模型的真实成本、编辑与质量差异

    OpenRouter 用同一提示词实测20个图像生成模型的真实计费,1024x1024 单张图价格在 $0.006(openai/gpt-image-2)到 $0.1344(google/gemini-3-pro-image)之间,相差22倍。

    推荐理由:原文用统一提示词实测20个图像模型的实际计费,给出按任务选模型的结论,比照牌价更可靠。

  3. Epoch AI50

    Epoch AI 推出 Benchmark Reviews,用于审计 AI 基准,首批发布 15 个基准的评审结果。其中 4 个 Verified,包括 WeirdML v2、ExploitBench v0.1、PostTrainBench v1.1 和 SimpleQA Verified;9 个 Flawed,包括 Terminal-Bench 4.0.0、SWE-Bench Verified、SWE-Bench Pro、Humanity's Last Exam、DeepSWE v1.1、TextQuests、Lech Mazur Writing、BFCL v4 和 HealthBench Professional;另有 CritPt 和 FrontierCode 因信息不足暂无法评审。

9月16日周三
9月9日周三