X:Artificial Analysis
@artificialanlys · X
切换来源
Artificial Analysis@ArtificialAnlysAI 评分4949
Artificial Analysis@ArtificialAnlysAI 评分5252
Artificial Analysis@ArtificialAnlysAI 评分5252引用Reflection@reflection_aiIntroducing Beam: a highly efficient agentic open model with 501B total parameters and 23B active. - Frontier reasoning efficiency - Advances the Western open frontier on coding & agentic tasks - Trained end-to-end from scratch Full weights release this month. Learn more about Beam: http://reflection.ai/beam
Artificial Analysis@ArtificialAnlysAI 评分5151
Artificial Analysis@ArtificialAnlysAI 评分5050
Artificial Analysis@ArtificialAnlys精选AI 评分7070
推荐理由:原文给出三大新模型组合在 Coding Agent Index 的得分与单任务成本对比,读者可以据此在性能和价格之间做选型权衡。
Artificial Analysis@ArtificialAnlys精选AI 评分6767
推荐理由:独立评测方自托管实测两个图像榜单排名,并对比上一代和同类开源模型,读者可了解其在开源阵营中的位置。
Artificial Analysis@ArtificialAnlysAI 评分4040Artificial Analysis 的 Coding Agent Index 新增安全拒绝报告,可查看拒绝发生在任务提示词阶段还是智能体已开始工作之后,以及拒绝后切换到了哪个回退模型。

Artificial Analysis@ArtificialAnlysAI 评分6262
Artificial Analysis@ArtificialAnlys精选AI 评分6767
推荐理由:第三方评测给出各档成本对比数字,读者可以据此判断 GPT-6.1 Sol 在成本效率上的位置。
Artificial Analysis@ArtificialAnlysAI 评分4444
Artificial Analysis@ArtificialAnlysAI 评分4646
Artificial Analysis@ArtificialAnlys精选AI 评分6666
推荐理由:原文拆解了 GPT-6.1 Sol 单任务成本下降的具体构成,读者可以了解降价来自更少的轮次和更低的缓存读取价格。
@ArtificialAnlys@ArtificialAnlysAI 评分3838 @ArtificialAnlys@ArtificialAnlysAI 评分2626 Artificial Analysis 编程智能体指数 1.5 中两个 Devin Fusion 配置的各项评测完整拆解:https://t.co/T2WYPZtTC6

@ArtificialAnlys@ArtificialAnlysAI 评分4747 
@ArtificialAnlys@ArtificialAnlysAI 评分5555 Artificial Analysis 独立评测 Cognition 今日发布的 Devin Fusion,这是多模型编码智能体首次进入其 Coding Agent Index。

@ArtificialAnlys@ArtificialAnlysAI 评分2929 
@ArtificialAnlys@ArtificialAnlysAI 评分77 @ArtificialAnlys@ArtificialAnlysAI 评分2222 Ling-3.0-flash-VL 在 Intelligence Index 每个任务上产生约 50k 输出 token。https://t.co/RjSboi7CGE

@ArtificialAnlys@ArtificialAnlysAI 评分3232 Ling-3.0-flash-VL 的幻觉率相对较低,为 22%。它尝试回答了约 34% 的 AA-Omniscience 问题。https://t.co/KL2AMS6Tpw

@ArtificialAnlys@ArtificialAnlysAI 评分4040 Ling-3.0-flash-VL 以 25 的智能指数和 5.5B 激活参数,位于智能指数与激活参数的帕累托前沿上。https://t.co/gqvh8hfla2

@ArtificialAnlys@ArtificialAnlysAI 评分6262 
@ArtificialAnlys@ArtificialAnlysAI 评分5555 @ArtificialAnlys@ArtificialAnlysAI 评分3232 



@ArtificialAnlys@ArtificialAnlys精选AI 评分7373 Artificial Analysis 的图像编辑 arena 显示,GPT Image 2.5 Sunburst 在 7 项编辑动作中领先 6 项,并在 10 个用例中领先 8 个。




推荐理由:榜单显示图像编辑的动作领先权从五家分散收拢到单一模型,可用于比较各家编辑能力分布。
@ArtificialAnlys@ArtificialAnlysAI 评分3838 



@ArtificialAnlys@ArtificialAnlysAI 评分4343 



@ArtificialAnlys@ArtificialAnlysAI 评分4040 
@ArtificialAnlys@ArtificialAnlysAI 评分5454 
@ArtificialAnlys@ArtificialAnlys精选AI 评分7070 OpenAI 发布 GPT Image 2.5 的 Flare 和 Sunburst 两款图像模型,在 Artificial Analysis 图像榜单包揽文生图与图像编辑的前两名。

推荐理由:评测显示两款新模型在文生图与图像编辑榜单占据前两位,输出价格与 GPT Image 2 持平。
@ArtificialAnlys@ArtificialAnlysAI 评分4545 @ArtificialAnlys@ArtificialAnlysAI 评分4040 Octen Search 每 1000 次任务搜索成本约 9 美元,每任务约 6 至 12 次搜索,按每 1000 次查询 1 美元计(较标准价 5 美元/1000 次查询打 2 折)。

@ArtificialAnlys@ArtificialAnlysAI 评分3030 
@ArtificialAnlys@ArtificialAnlysAI 评分4444 
@ArtificialAnlys@ArtificialAnlysAI 评分1515 查看下方 DeepSeek V4.1 Flash 的完整测试结果:https://t.co/kq5EFXjd32

@ArtificialAnlys@ArtificialAnlysAI 评分2222 前往 Artificial Analysis 将 DeepSeek V4.1 Flash 与其他模型进行对比:https://t.co/Ks6lZigqTw
@ArtificialAnlys@ArtificialAnlysAI 评分2626 AA-Omniscience 提升 9 分至 -5.3,准确率从 40% 升至 46%,但非幻觉率从 8% 降至 4%。https://t.co/50iZob5SrO

@ArtificialAnlys@ArtificialAnlys精选AI 评分8383 
推荐理由:文中给出同一套指数下的横向对比和每任务成本,可据此判断轻量模型与旗舰 Pro 之间的性价比差距。
@ArtificialAnlys@ArtificialAnlysAI 评分2020 尽管每 token 价格更低,但由于其冗长,每任务成本仍达到 $0.27,不过仍显著低于大多数开放权重同类模型。https://t.co/1CADy2wklh
