VTR-Bench:视频生成中视觉文本渲染能力的系统评测基准
VTR-Bench 提出一套系统评测基准,专门评估视频生成模型的视觉文本渲染能力,包含 300 个覆盖广告、科学视频等五类场景的提示词,并开发了与人工对齐的自动化评测流程。
VTR-Bench 提出一套系统评测基准,专门评估视频生成模型的视觉文本渲染能力,包含 300 个覆盖广告、科学视频等五类场景的提示词,并开发了与人工对齐的自动化评测流程。
KaliBench 是一个面向 Kali Linux 上自然语言到 CLI 命令转换的细粒度基准与数据集,包含 8,504 对查询-命令,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。
PROWBench 是一个评估视频模型对程序指定世界事件还原保真度的基准,包含 170 个程序化构建的片段和 600 段代理视频,记录实体状态与带时间戳事件(含镜头视野外事件)作为可重放世界记录。
Signal65 报告测试显示,高通 18 核骁龙 X2 Elite(X2E-88-100)在 CPU、AI 和多数续航项目中领先英特尔酷睿 Ultra X7 358H。
推荐理由:原文给出三大新模型组合在 Coding Agent Index 的得分与单任务成本对比,读者可以据此在性能和价格之间做选型权衡。
推荐理由:独立评测方自托管实测两个图像榜单排名,并对比上一代和同类开源模型,读者可了解其在开源阵营中的位置。
PostTrainBench v1.2 is out! A few updates: 1. Cloud GPU support. You can now run the benchmark with identical settings through Harbor + Modal using our new Harbor adapter. 2. New leaderboard leaders. Fable 5.1 takes #1 at 44.6%, followed by Opus 5.5 at 43.8% and GPT-6 (Astra) at 41.9%. 3. Evaluation fixes. Removed BFCL, fixed HumanEval and remote-code scoring, added averaging across multiple seeds, and switched contamination checks to majority vote.
Claude Opus 5.5 has taken the top spot on the Epoch Capabilities Index (ECI) with a score of 167, narrowly ahead of GPT-6 Astra. Claude Sonnet 5.5 has roughly matched Claude Fable 5.1 (165).
推荐理由:原文拆解了 GPT-6.1 Sol 单任务成本下降的具体构成,读者可以了解降价来自更少的轮次和更低的缓存读取价格。
给基准测试爱好者们:一个很酷的新数据集,面向 SRE 类型的工作
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
Google 回来了??? 全面优于 Astra 和 Opus 5.5。 如果这不只是刷榜,我很想看到他们重新加入竞赛。
这是 Gemini 4 Argon 基准测试的预览。 今天开始向网络防御者推出,并尽快向所有人开放。 很高兴看到所有这些进展,迫不及待想让你们都用上!




研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型。指标包括基于 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 流式延迟、WavLM 嵌入的说话人相似度(SIM),把评估周期从数周缩短到数小时。
Claude Opus 5.5 本周发布,以 88.4% 登顶 SimpleBench,并被 Anthropic 评为迄今最强视觉模型,成本比 Fable 5.1 低约 60%。在 Terminal-Bench-Science 上,其得分从低推理投入的 24% 升至 xhigh 的 62%,max 档反降至 59%。社区反馈称 200 美元的 Claude Code 套餐已胜过 Codex。
研究提出 MIST(Misleading-Image Stress Test),用 200 句可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。
研究者推出 BIABench,一个由 16 项已发表生物学研究重建而成的基准,保留原始科学问题、成像数据与 ground truth,覆盖从 H&E 组织学到单分子定位显微镜的 11 类分析子任务。
AI 能看出你把宜家家具装错了吗?我们的新基准——家具组装基准(FAB)——把说明书和一张组装到一半的家具照片交给模型,让它们找出错误。 最高分在短短 10 个月内从 28% 升到了 80%。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,衡量模型回复的助益性与安全性。
karminski 发布小米 MiMo-v2.6-pro 测试速报,向量数据库测试得分从 MiMo-v2.5-Pro 的 2505 升至 7810,接近 Claude Fable-5。



阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。
推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
如果你在用 AI 构建产品,你应该花超过 25% 的时间做基准测试,并努力让模型实验室关注这些基准测试 这是加速公司进展的最简单路径
OpenRouter 在 2026-09-21 用 HaluEval 88 条标注数据和 SummEval 50 条专家评分摘要对比 typesafe/jev-1.13 与 openai/gpt-5.6-luna 两种评测判官。
LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。
Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.
OpenRouter 用同一提示词实测20个图像生成模型的真实计费,1024x1024 单张图价格在 $0.006(openai/gpt-image-2)到 $0.1344(google/gemini-3-pro-image)之间,相差22倍。
推荐理由:原文用统一提示词实测20个图像模型的实际计费,给出按任务选模型的结论,比照牌价更可靠。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
OpenRouter 发布 Seedance 2.5 评测。该模型自 2026 年 8 月 7 日上线其视频 API,支持 4 到 30 秒、480p 或 720p、首尾帧控制及图像、视频、音频引用,音频同趟生成不加价。