推荐理由:原文给出三大新模型组合在 Coding Agent Index 的得分与单任务成本对比,读者可以据此在性能和价格之间做选型权衡。
#评测/基准
#评测/基准
今日 2 条
Artificial Analysis@ArtificialAnlys精选AI 评分7070
Artificial Analysis@ArtificialAnlys精选AI 评分6767
推荐理由:独立评测方自托管实测两个图像榜单排名,并对比上一代和同类开源模型,读者可了解其在开源阵营中的位置。
Artificial Analysis@ArtificialAnlysAI 评分4444
Artificial Analysis@ArtificialAnlysAI 评分4646
Artificial Analysis@ArtificialAnlys精选AI 评分6666
推荐理由:原文拆解了 GPT-6.1 Sol 单任务成本下降的具体构成,读者可以了解降价来自更少的轮次和更低的缓存读取价格。
Ammaar Reshi@ammaarAI 评分4141这是 Gemini 4 Argon 基准测试的预览。 今天开始向网络防御者推出,并尽快向所有人开放。 很高兴看到所有这些进展,迫不及待想让你们都用上!

karminski-牙医@karminski3AI 评分5252karminski 发布小米 MiMo-v2.6-pro 测试速报,向量数据库测试得分从 MiMo-v2.5-Pro 的 2505 升至 7810,接近 Claude Fable-5。




elsewhere articles精选AI 评分6565 Step 5 Preview 实测:榜单之外的真实表现与短板
阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。
推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。
Epoch AI@EpochAIResearchAI 评分4848
NVIDIA BlogAI 评分4343 NVIDIA Vera Rubin NVL72 首登 MLPerf Inference v6.1,性能领先
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
SiliconFlow@SiliconFlowAIAI 评分3434