跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 37 条
10月5日周一
10月3日周六
  1. OpenRouter Announcements61

    OpenRouter 发布 Model Router Benchmarks 页面,横向对比多个模型路由器

    OpenRouter 推出 Model Router Benchmarks 页面,对 Auto Router、Fugu、Jev Router 等路由器在质量、速度和成本三个维度上跑分对比,Router Index 默认按质量 60%、时间 20%、成本 20% 加权出 0 到 10 的综合分。

    推荐理由:原文给出路由器的分类方式和质量、速度、成本的加权评分方法,读者可以据此判断何时值得用路由器替代单一模型。

10月2日周五
10月1日周四
9月22日周二
9月19日周六
9月18日周五
  1. OpenRouter Announcements80

    OpenRouter 实测20个图像生成模型的真实成本、编辑与质量差异

    OpenRouter 用同一提示词实测20个图像生成模型的真实计费,1024x1024 单张图价格在 $0.006(openai/gpt-image-2)到 $0.1344(google/gemini-3-pro-image)之间,相差22倍。

    推荐理由:原文用统一提示词实测20个图像模型的实际计费,给出按任务选模型的结论,比照牌价更可靠。

9月12日周六
9月9日周三
  1. @charlieholtz69

    Charlie Holtz 分享了对个人 AI 助理 Muse 的上手第一印象,称其浏览器操作速度很快,模型在近一周左右明显进步、回复不再冗长,还会把内容拆成多条消息并对用户消息加 emoji 回应。Muse 由 alexandr_wang 宣布推出,定位为常驻在线、能使用浏览器并连接应用的个人助理。他还提到可以创建自定义头像,它会边工作边打字。

    引用@alexandr_wang@alexandr_wang

    1/ today we're rolling out Muse, our new personal ai assistant. Muse is always-on, wicked fast, can use a browser, connect to your apps, and is designed to be secure. try it now: https://t.co/n7swQh9v6C. https://t.co/Yb783uwpJ5

    推荐理由:作者分享 Muse 的上手体验,提到浏览器操作速度与模型回复风格的变化,可供了解个人 AI 助理的实际表现。

9月5日周六
  1. 数字生命卡兹克 · 微信公众号78

    实测 GPT-6 Astra:OpenAI 曾经的黄金时代回来了

    GPT-6 Astra 已向所有订阅用户推送,作者在 ChatGPT 和 Codex 中实测后认为其综合能力追平 Claude Fable 5,速度比 GPT-5.6 Sol 大幅提升。前端与 3D 网页生成的细节和形式感提升明显,代码审查深度加强,一次系统性能审查列出大量问题并在约 2 小时内完成修复。作者还给出简化后的 AGENT.md 和手动开启 Codex 实验性上下文管理的配置方法。

    推荐理由:作者以第一手实测对比 GPT-5.6 Sol,给出速度、前端 3D 生成和代码能力上的直观差异。

9月4日周五
  1. @kimmonismus68

    GPT-6 Astra 在 Epoch AI 的能力指数(ECI)上取得 169 分,刷新此前 163 分的纪录。

    引用@EpochAIResearch@EpochAIResearch

    GPT-6 Astra has set a new ECI record, with a score of 169. This is a substantial jump from the prior best (163), but is within our uncertainty range for the reasoning-era ECI trend. Astra also set new records on our math, continual learning, and game-puzzles benchmarks. On our long-horizon coding benchmark, MirrorCode, Astra ranks between Opus 4.7 and Fable 5. OpenAI gave us pre-release access to test Astra. Charts and more details for Astra’s individual benchmark results in the thread.

    推荐理由:借 Epoch 与 Artificial Analysis 两套指数的分歧,可以看清单个能力纪录与综合实用性评价之间的差距。

  2. @gdb71

    OpenAI 发布 GPT-6 Astra,称其在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上达到 SOTA,并在 Terminal-Bench Science 0.1 和 HealthBench Pro 上取得领先。随附基准表显示,Astra 在 ARC-AGI-3 上为 99.9%,GPT-5.6 Sol 为 7.8%;在 Terminal-Bench Science 0.1 上为 64.6%,Sol 为 22.4%。Greg Brockman 表示期待 Astra 在创业、科学发现以及小团队解决大问题上的表现。

    引用@OpenAI@OpenAI

    GPT-6 Astra is state-of-the-art on FrontierMath Tier 4, ARC-AGI 3, and TerminalBench-4.0. GPT‑6 Astra is also a major advance for scientific discovery, with state-of-the-art performance on Terminal-Bench Science 0.1 and HealthBench Pro. https://t.co/7hEFadVAN9

    推荐理由:表格列出 GPT-6 Astra 在七项基准上的成绩,并与 GPT-5.6 Sol 横向对照。

9月3日周四
9月2日周三
  1. @AISafetyMemes77

    Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,超过 Fable 5 的 24.7%;在 Terminal-Bench 4.0 上以 55.8% 对 42.0% 领先,GDPval-AA v2 上为 1853 对 1723。引用内容称该模型在多项基准上刷新标准。作者指出这两代之间只相隔 2.5 个月,而不是数年。

    引用@claudeai@claudeai

    Across our benchmarks, the model sets a new standard. It scores 52.6% on Terminal-Bench-Science 0.1, more than double Fable 5. On Terminal-Bench 4.0, it scores 55.8% against 42.0% for Fable 5. https://t.co/aSb72LSxee

    推荐理由:表格把 Fable 5.1 与 Fable 5 放在同一组基准上对比,可直观看到两代之间的分数差距。