a16z 发布第七期 Top 100 消费级 AI 应用榜单,首次引入消费支出排名
a16z 发布第七期 Top 100 消费级 AI 应用榜单,按 Similarweb 月访问量和 Sensor Tower 月活排名,并首次联合 YipitData 增加美国消费卡支出排名。
推荐理由:a16z 第七期消费 AI 百强榜首次加入 YipitData 消费支出数据,展示了付费集中于重度用户的结构与流量榜的差异。
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
当前仅显示精选新闻a16z 发布第七期 Top 100 消费级 AI 应用榜单,按 Similarweb 月访问量和 Sensor Tower 月活排名,并首次联合 YipitData 增加美国消费卡支出排名。
推荐理由:a16z 第七期消费 AI 百强榜首次加入 YipitData 消费支出数据,展示了付费集中于重度用户的结构与流量榜的差异。
OpenRouter 推出 Model Router Benchmarks 页面,对 Auto Router、Fugu、Jev Router 等路由器在质量、速度和成本三个维度上跑分对比,Router Index 默认按质量 60%、时间 20%、成本 20% 加权出 0 到 10 的综合分。
推荐理由:原文给出路由器的分类方式和质量、速度、成本的加权评分方法,读者可以据此判断何时值得用路由器替代单一模型。
推荐理由:原文给出三大新模型组合在 Coding Agent Index 的得分与单任务成本对比,读者可以据此在性能和价格之间做选型权衡。
推荐理由:独立评测方自托管实测两个图像榜单排名,并对比上一代和同类开源模型,读者可了解其在开源阵营中的位置。
推荐理由:原文拆解了 GPT-6.1 Sol 单任务成本下降的具体构成,读者可以了解降价来自更少的轮次和更低的缓存读取价格。
阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。
推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
OpenRouter 发布教程,用 60 张客服工单分类和 40 条 Prompt 注入筛查对比 TypeSafe 决策模型 Jev 1.13、GPT Luna 和 Claude Opus。
推荐理由:基于同一批工单的实测数字对比决策模型与生成式 LLM 的成本、延迟和准确率,并给出两种可直接复用的组合模式。
OpenRouter 用同一提示词实测20个图像生成模型的真实计费,1024x1024 单张图价格在 $0.006(openai/gpt-image-2)到 $0.1344(google/gemini-3-pro-image)之间,相差22倍。
推荐理由:原文用统一提示词实测20个图像模型的实际计费,给出按任务选模型的结论,比照牌价更可靠。
Artificial Analysis 的图像编辑 arena 显示,GPT Image 2.5 Sunburst 在 7 项编辑动作中领先 6 项,并在 10 个用例中领先 8 个。




推荐理由:榜单显示图像编辑的动作领先权从五家分散收拢到单一模型,可用于比较各家编辑能力分布。
1/ today we're rolling out Muse, our new personal ai assistant. Muse is always-on, wicked fast, can use a browser, connect to your apps, and is designed to be secure. try it now: https://t.co/n7swQh9v6C. https://t.co/Yb783uwpJ5
推荐理由:作者分享 Muse 的上手体验,提到浏览器操作速度与模型回复风格的变化,可供了解个人 AI 助理的实际表现。
GPT-6 Astra 已向所有订阅用户推送,作者在 ChatGPT 和 Codex 中实测后认为其综合能力追平 Claude Fable 5,速度比 GPT-5.6 Sol 大幅提升。前端与 3D 网页生成的细节和形式感提升明显,代码审查深度加强,一次系统性能审查列出大量问题并在约 2 小时内完成修复。作者还给出简化后的 AGENT.md 和手动开启 Codex 实验性上下文管理的配置方法。
推荐理由:作者以第一手实测对比 GPT-5.6 Sol,给出速度、前端 3D 生成和代码能力上的直观差异。
GPT-6 Astra 在 Epoch AI 的能力指数(ECI)上取得 169 分,刷新此前 163 分的纪录。


GPT-6 Astra has set a new ECI record, with a score of 169. This is a substantial jump from the prior best (163), but is within our uncertainty range for the reasoning-era ECI trend. Astra also set new records on our math, continual learning, and game-puzzles benchmarks. On our long-horizon coding benchmark, MirrorCode, Astra ranks between Opus 4.7 and Fable 5. OpenAI gave us pre-release access to test Astra. Charts and more details for Astra’s individual benchmark results in the thread.
推荐理由:借 Epoch 与 Artificial Analysis 两套指数的分歧,可以看清单个能力纪录与综合实用性评价之间的差距。
Meta 的 Muse Image 在 Artificial Analysis 图像编辑榜首次入榜排第 4,文生图榜排第 5,并进入质量与价格 Pareto 前沿。
推荐理由:榜单给出 Muse Image 与 GPT Image 2、Nano Banana 2 的同场排名对照,读者可了解其图像编辑与文生图位置。
GPT-6 Astra is state-of-the-art on FrontierMath Tier 4, ARC-AGI 3, and TerminalBench-4.0. GPT‑6 Astra is also a major advance for scientific discovery, with state-of-the-art performance on Terminal-Bench Science 0.1 and HealthBench Pro. https://t.co/7hEFadVAN9
推荐理由:表格列出 GPT-6 Astra 在七项基准上的成绩,并与 GPT-5.6 Sol 横向对照。
推荐理由:对比两个旗舰榜单的成本与 token 效率,可以看到 GPT-6 Astra 在编码任务上的成本优势被整体涨价抵消。
Meta 发布 Muse Spark 1.3,这是其五个月内第四次发布 Muse Spark 模型,xhigh 版本在 Artificial Analysis 智能指数得 61 分。
推荐理由:第三方评测显示 Muse Spark 1.3 智能指数升至 61,与多个前沿模型持平,单任务成本在同分档模型中最低。
通义千问宣布 Qwen3.8-Max-0902 在 Code Arena 总榜排名第一,并位于每百万 token 5 美元价格档的帕累托前沿。该模型可在 QwenCloud 上试用。
推荐理由:官方给出 Code Arena 登顶与每百万 token 5 美元的价格位置,可据此判断编码模型的性价比区间。
Across our benchmarks, the model sets a new standard. It scores 52.6% on Terminal-Bench-Science 0.1, more than double Fable 5. On Terminal-Bench 4.0, it scores 55.8% against 42.0% for Fable 5. https://t.co/aSb72LSxee
推荐理由:表格把 Fable 5.1 与 Fable 5 放在同一组基准上对比,可直观看到两代之间的分数差距。
推荐理由:评测给出 Claude Fable 5.1 的智能指数分数与单任务成本,可对照它在 Fable 5 和 Opus 5 之间的性能与价格取舍。