| 01 | GPT-6 AstraOpenAI上线 2026-09-03 · 证据敏感缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.23 | | 2 项评测证据敏感名次浮动范围第 1 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥6.7 | ¥67.05 | ¥335.23 | 96.9 |
| 02 | Ogpt-6.1-solopenai上线 — · 证据敏感缓存输入 —输入 — · 输出 — | | 2 项评测证据敏感名次浮动范围第 2 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | 待核验 | 待核验 | 待核验 | 95.4 |
| 03 | Gemini 3.1 Pro PreviewGoogle上线 2026-02-19 · 证据敏感缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.45 | | 2 项评测证据敏感名次浮动范围第 3 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥13.41 | ¥80.45 | 94.6 |
| 04 | Claude Opus 5.5Anthropic上线 2026-09-17 · 证据敏感缓存输入 ¥1.34输入 ¥26.82 · 输出 ¥134.09 | | 2 项评测证据敏感名次浮动范围第 4 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥26.82 | ¥134.09 | 91.5 |
| 05 | Gemini 3.8 FlashGoogle上线 2026-09-02 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围5—6 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 90.2 |
| 06 | Gemini 3.7 FlashGoogle上线 2026-08-13 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围6—8 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 88.9 |
| 07 | GPT-5.6 SolOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥2.68输入 ¥26.82 · 输出 ¥134.09 | | 2 项评测证据敏感名次浮动范围6—7 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥2.68 | ¥26.82 | ¥134.09 | 88.9 |
| 08 | Claude Fable 5Anthropic上线 2026-06-09 · 证据敏感缓存输入 ¥6.7输入 ¥67.05 · 输出 ¥335.23 | | 2 项评测证据敏感名次浮动范围5—8 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥6.7 | ¥67.05 | ¥335.23 | 88.5 |
| 09 | Gemini 3.6 FlashGoogle上线 2026-07-21 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围9—10 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 86.3 |
| 10 | Gemini 3.5 FlashGoogle上线 2026-05-19 · 证据敏感缓存输入 ¥1.01输入 ¥10.06 · 输出 ¥60.34 | | 2 项评测证据敏感名次浮动范围10—11 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥1.01 | ¥10.06 | ¥60.34 | 85.2 |
| 11 | Gemini 3 Flash PreviewGoogle上线 2025-12-17 · 证据敏感缓存输入 ¥0.34输入 ¥3.35 · 输出 ¥20.11 | | 2 项评测证据敏感名次浮动范围9—11 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.34 | ¥3.35 | ¥20.11 | 84.4 |
| 12 | GPT-5.5OpenAI上线 2026-04-23 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥201.14 | | 2 项评测证据敏感名次浮动范围第 12 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥201.14 | 80.6 |
| 13 | GPT-6 SolOpenAI上线 2026-09-22 · 证据敏感缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥67.05 | | 2 项评测证据敏感名次浮动范围第 13 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥13.41 | ¥67.05 | 79.2 |
| 14 | Claude Opus 5Anthropic上线 2026-07-24 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.61 | | 2 项评测证据敏感名次浮动范围第 14 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥167.61 | 77.2 |
| 15 | Grok 4.7xAI上线 2026-09-21 · 证据敏感缓存输入 ¥3.35输入 ¥13.41 · 输出 ¥40.23 | | 2 项评测证据敏感名次浮动范围第 15 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥13.41 | ¥40.23 | 70.7 |
| 16 | Qwen3.7 MaxAlibaba上线 2026-05-19 · 证据敏感缓存输入 ¥2.4输入 ¥12 · 输出 ¥36 | | 2 项评测证据敏感名次浮动范围第 16 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥2.4 | ¥12 | ¥36 | 68.6 |
| 17 | DeepSeek V4 Pro 0813DeepSeek上线 2026-08-13 · 证据敏感缓存输入 ¥0.3输入 ¥9 · 输出 ¥27 | | 2 项评测证据敏感名次浮动范围17—18 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.3 | ¥9 | ¥27 | 64.0 |
| 18 | Claude Opus 4.8Anthropic上线 2026-05-28 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.61 | | 2 项评测证据敏感名次浮动范围17—18 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥167.61 | 63.6 |
| 19 | Kimi K3Moonshot AI上线 2026-07-16 · 证据敏感缓存输入 ¥2输入 ¥20 · 输出 ¥100 | | 2 项评测证据敏感名次浮动范围19—21 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥2 | ¥20 | ¥100 | 60.7 |
| 20 | Qwen3.6 Max PreviewAlibaba上线 2026-04-20 · 证据敏感缓存输入 ¥0.9输入 ¥9 · 输出 ¥54 | | 2 项评测证据敏感名次浮动范围19—20 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.9 | ¥9 | ¥54 | 60.6 |
| 21 | Claude Opus 4.7Anthropic上线 2026-04-16 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.61 | | 2 项评测证据敏感名次浮动范围20—21 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥167.61 | 59.0 |
| 22 | Grok 4.6xAI上线 2026-08-12 · 证据敏感缓存输入 ¥3.35输入 ¥13.41 · 输出 ¥40.23 | | 2 项评测证据敏感名次浮动范围22—24 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥13.41 | ¥40.23 | 56.9 |
| 23 | GPT-5 2025-08-07OpenAI上线 2025-08-07 · 证据敏感缓存输入 ¥0.84输入 ¥8.38 · 输出 ¥67.05 | | 2 项评测证据敏感名次浮动范围22—24 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.84 | ¥8.38 | ¥67.05 | 56.2 |
| 24 | Grok 4.5xAI上线 2026-07-08 · 证据敏感缓存输入 ¥2.01输入 ¥13.41 · 输出 ¥40.23 | | 2 项评测证据敏感名次浮动范围23—26 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥2.01 | ¥13.41 | ¥40.23 | 55.7 |
| 25 | o3 2025-04-16OpenAI上线 2025-04-16 · 证据敏感缓存输入 ¥3.35输入 ¥13.41 · 输出 ¥53.64 | | 2 项评测证据敏感名次浮动范围23—25 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥13.41 | ¥53.64 | 54.8 |
| 26 | Qwen3.8 Max 0902Alibaba上线 2026-09-01 · 证据敏感缓存输入 —输入 ¥12 · 输出 ¥36 | | 2 项评测证据敏感名次浮动范围26—29 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | — | ¥12 | ¥36 | 53.8 |
| 27 | GPT-5.1 2025-11-13OpenAI上线 2025-11-13 · 证据敏感缓存输入 ¥0.84输入 ¥8.38 · 输出 ¥67.05 | | 2 项评测证据敏感名次浮动范围26—29 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | ¥0.84 | ¥8.38 | ¥67.05 | 53.2 |
| 28 | Qwen3 Max 2025-09-23Alibaba上线 2025-09-24 · 证据敏感缓存输入 —输入 ¥6 · 输出 ¥24 | | 2 项评测证据敏感名次浮动范围25—30 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | — | ¥6 | ¥24 | 52.5 |
| 29 | claude-sonnet-5.5anthropic上线 — · 证据敏感缓存输入 —输入 — · 输出 — | | 2 项评测证据敏感名次浮动范围26—31 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | 待核验 | 待核验 | 待核验 | 52.3 |
| 30 | GPT-5.4 Pro 2026-03-05OpenAI上线 2026-03-05 · 证据敏感缓存输入 —输入 ¥201.14 · 输出 ¥1,206.81 | | 2 项评测证据敏感名次浮动范围27—32 名在 8 个对照情景中重新检查资格后的名次。 3 个情景下参评证据不足。不是置信区间。 | — | ¥201.14 | ¥1,206.81 | 50.5 |