跳到正文

#评测/基准

今日 6 条
今天10月2日周五
  1. Hugging Face Daily Papers35

    泛化即稳定性而非准确性:LLM 的多轴评估

    一项研究提出以稳定性为核心的泛化评估框架 SAGO,在单样本层面、多输入变体及多行为维度上衡量 LLM 对同一输入的行为变化,而非仅看基准准确率。结果显示,许多常用模型存在统计显著的泛化不稳定:没有模型能均匀泛化,行为轴捕捉到独立失败模式,跨数据集变化甚至可能逆转模型排名。该论文已被 NeurIPS 2026 的 TAE 研讨会接收。

  2. Hugging Face Daily Papers44

    Argo-Bench:评估数据智能体在企业级工作流中的表现

    Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。

  3. Karina34

    一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多一个小时,每个智能体能获得多少提升!

    引用Thoughtful@thoughtfullab

    PostTrainBench v1.2 is out! A few updates: 1. Cloud GPU support. You can now run the benchmark with identical settings through Harbor + Modal using our new Harbor adapter. 2. New leaderboard leaders. Fable 5.1 takes #1 at 44.6%, followed by Opus 5.5 at 43.8% and GPT-6 (Astra) at 41.9%. 3. Evaluation fixes. Removed BFCL, fixed HumanEval and remote-code scoring, added averaging across multiple seeds, and switched contamination checks to majority vote.

10月1日周四
9月30日周三
  1. Hugging Face Daily Papers43

    让 AI 审稿人更可信:RobustReview 基准与 SciCore 审稿模型

    研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。

  2. Hugging Face Daily Papers33

    PhysVista:通过感知-推理-评估闭环基准测试VLM的物理智能

    PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。

9月29日周二
9月28日周一
  1. Hugging Face Daily Papers37

    Endless Exam:面向超级智能的数学构造基准,覆盖 14 类参数化问题族

    研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。

9月24日周四
9月23日周三
9月18日周五
  1. Epoch AI50

    Epoch AI 推出 Benchmark Reviews,用于审计 AI 基准,首批发布 15 个基准的评审结果。其中 4 个 Verified,包括 WeirdML v2、ExploitBench v0.1、PostTrainBench v1.1 和 SimpleQA Verified;9 个 Flawed,包括 Terminal-Bench 4.0.0、SWE-Bench Verified、SWE-Bench Pro、Humanity's Last Exam、DeepSWE v1.1、TextQuests、Lech Mazur Writing、BFCL v4 和 HealthBench Professional;另有 CritPt 和 FrontierCode 因信息不足暂无法评审。

8月17日周一
7月28日周二
5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月17日周五
  1. AI as Normal Technology74

    Sayash Kapoor 等人提出开放世界评测并发布 CRUX 项目,AI 智能体成功上架 iOS 应用

    Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。

    推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。

4月1日周三
3月19日周四
3月17日周二
  1. Google Research49

    Google 用高温超导研究问题测试 LLM:NotebookLM 与自建 RAG 系统表现最佳

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家盲评打分。NotebookLM 在多数维度表现突出,自建 RAG 系统紧随其后,两者与 Gemini 在观点平衡性和答案全面性上排名前三。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。