跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

当前仅显示精选新闻
574条精选相关主题产品更新论文研究开源生态

最新精选

第 141–160 条 · 共 574 条
9月3日周四
  1. @rohanpaul_ai67

    Meta 发布 Muse Spark 1.3,称相比 1.2 工具调用减少 20%、生成 token 减少 25%,长编码任务可用更少的模型动作和输出来完成同一交付物。该版本在 MRCR 256K–512K 上得分 98.5,超过 GPT-5.6 Sol;在 JobBench(64.9 对 65.7)、OSWorld(66.9 对 68.3)和 AutomationBench(49.4 对 50.3)上接近 Opus 5。转发的官方公告称该版本当天在 Muse Code 和 API 上线,并预告开放权重版本即将发布。

    引用@finkd@finkd

    Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we've made so far on coding and agentic work. Try it in Muse Code and our API. Next up 🍉 and Muse Spark open weights releases coming soon. https://t.co/XQQEDEJGD7

    推荐理由:对比表格列出 Muse Spark 1.3 与 GPT-5.6 Sol、Opus 5 在长上下文和智能体基准上的差距,可看出其性能定位。

  2. @fofrAI74

    Google DeepMind 发布两款 Gemini 新模型:3.8 Flash 与 3.8 Flash Cyber。3.8 Flash 在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,3.8 Flash Cyber 则主打前沿水平的漏洞检测与自动修补。

    引用@GoogleDeepMind@GoogleDeepMind

    Two new Gemini models are here to help scale your AI agents and secure code: 🔘 3.8 Flash: our most intelligent model yet with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. 🔘 3.8 Flash Cyber: our most capable cybersecurity model with frontier-level vulnerability detection and automated patching.

    推荐理由:Google 一次发布两款 Gemini 3.8 Flash 模型,分别面向智能体任务与代码安全,可对照 3.7 Flash 看提升方向。

9月2日周三
  1. @omarsar067

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款模型。前者在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,后者面向网络安全,具备前沿级漏洞检测与自动修补能力。Elvis Saravia 称 Gemini 3.8 Flash 的定价有吸引力,并认为 3.8 Flash Cyber 在修补能力上处于 Pareto 前沿。

    引用@GoogleDeepMind@GoogleDeepMind

    Two new Gemini models are here to help scale your AI agents and secure code: 🔘 3.8 Flash: our most intelligent model yet with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. 🔘 3.8 Flash Cyber: our most capable cybersecurity model with frontier-level vulnerability detection and automated patching.

    推荐理由:随推附上的对比表把 Gemini 3.8 Flash 的定价与多项基准成绩与 Claude、GPT-5.6 并列,便于横向比较。

  2. @OfficialLoganK65

    Gemini 3.8 Flash 发布,主打智能体与编码能力提升,是 6 周内第三个更新的 Flash 模型。推文附带的对比表显示,其输入价格 $0.75/1M tokens、输出价格 $3.75/1M tokens,Terminal-bench 2.1 得 89.4%,LBVBench 长视频理解得 87.8%(agentic)。优惠价有效期至 2026 年 12 月 31 日,2027 年 1 月 1 日起将调整为输入 $1.50/1M tokens、输出 $7.50/1M tokens。

    推荐理由:原文列出 Gemini 3.8 Flash 的价格与多项基准对比,读者可据此判断其智能体和编码能力相较前代及竞品的位置。

  3. @GoogleAI74

    Google 将 3.8 Flash 开放给 Google AI Pro 与 Ultra 订阅者,覆盖 Gemini App、Google 搜索 AI Mode 和 Google Sheets。开发者可通过 Google AI Studio 与 Android Studio 的 Gemini API 使用,在 antigravity 中探索 agent-first 工作流,并在 stitch 中用 3.8 Flash 生成 UI。Gemini Enterprise 用户可在下拉模型菜单或 Gemini Enterprise Agent Platform 中选择该模型。https://t.co/OzPm3Et10i

    推荐理由:原文列出 3.8 Flash 在订阅端、开发者工具和企业平台的具体开放入口,读者可据此判断自己能否用上。

  4. @GoogleDeepMind67

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两款新模型,前者面向智能体与软件工程,后者面向代码安全。官方称 3.8 Flash 是迄今最智能的模型,在软件工程、智能体任务和多步推理上相较 3.7 Flash 有明显提升。3.8 Flash Cyber 则具备前沿水平的漏洞检测与自动化补丁修复能力。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方列出两款 3.8 Flash 的定位差异与相对 3.7 Flash 的提升方向,便于判断编码与安全场景的选型。

  5. @GoogleDeepMind65

    Google DeepMind 宣布推出 Fairwind 计划,为政府和可信合作伙伴提供 3.8 Flash Cyber 的访问权限,用于保护关键基础设施和国家安全。Gemini 3.8 Flash 正在 Antigravity 中推送,并通过 Google AI Studio 和 Android Studio 的 API 提供。Google AI Pro 和 Ultra 订阅者可在 Gemini App 及 Google Search 的 AI Mode 中使用 3.8 Flash。

    原始视频预览图;未保存可播放视频URL

    推荐理由:官方公布了 Fairwind 计划与 Gemini 3.8 Flash 的推送渠道,读者可据此了解面向政府和关键基础设施的接入方式。

  6. @kimmonismus66

    Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数量 2.4T、上下文 1M tokens,已在 QwenCloud API 上线,定价为每 1M tokens 输入 $2、输出 $6,并针对 Coding 与 Cowork 做了后训练。作者称该版本在基准上已接近 Fable 5,并注意到如此明显的提升已不再伴随版本号变化,同时认为中国实验室与美国的差距正在缩小。

    引用@Alibaba_Qwen@Alibaba_Qwen

    🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built for real world complexity. Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and long horizon workflows. 💰Pricing per 1M tokens: $2 input, $6 output. $0.17 explicit cache hit, $0.25 implicit cache hit. Now live via API on QwenCloud. Come try it! 🙌 API: https://t.co/dq3WgMk980

    推荐理由:材料给出 Qwen3.8-Max-0902 的参数、上下文与定价,作者由此讨论版本迭代节奏和中美实验室差距的缩小。

  7. AI寒武纪 · 微信公众号77

    Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1 双旗舰模型,缓存读取价格降 75%

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1 两款底层架构相同、安全防护等级不同的模型,Fable 5.1 面向大众开放,Mythos 5.1 仅通过可信访问计划向特定机构开放。

    推荐理由:缓存读取价格下调75%并给出分子设计与金星地形重建案例,便于对比新旗舰的能力与成本结构。

  8. @AYi_AInotes67

    阿里更新旗舰模型 Qwen3.8-Max-0902,在 CodeArena WebDev 榜单以 1691 分排名第一,超过 Claude Opus 5 的 1688 分和 Kimi K3 的 1674 分,较前代 Qwen3.8-Max 的 1669 分高出 22 分。

    引用@Alibaba_Qwen@Alibaba_Qwen

    🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902! 2.4T parameters. 1M context tokens. Built for real world complexity. Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and long horizon workflows. 💰Pricing per 1M tokens: $2 input, $6 output. $0.17 explicit cache hit, $0.25 implicit cache hit. Now live via API on QwenCloud. Come try it! 🙌 API: https://t.co/dq3WgMk980

    推荐理由:列出新版 Qwen 在代码榜单的排位与每百万 tokens 定价,可据此评估替换现有 Agent 底座的成本。

  9. @alibaba_cloud73

    阿里云将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,支持 1M token 上下文,并称其在 Coding 与 Cowork 上做了进一步后训练,在复杂企业任务、科学研究和长周期工作流上表现更强。定价为每 1M token 输入 2 美元、输出 6 美元,显式缓存命中 0.17 美元,隐式缓存命中 0.25 美元。模型可通过阿里云 Model Studio 与 Qwen Cloud 调用。

    推荐理由:官方给出参数规模、上下文长度与分档定价,读者可据此评估它在长周期企业任务中的成本与适用性。

  10. @rohanpaul_ai71

    OpenAI 表示 Astra 是其首个达到 Preparedness Framework 关键网络安全能力阈值的模型,将带额外的 chain-of-thought 监控发布,分类器可自动阻止潜在的未授权操作。

    引用@OpenAI@OpenAI

    As we prepare to release Astra, we’re focused on making increasingly capable AI safe and broadly accessible. Astra represents a significant advance in cybersecurity capability, reaching the Critical threshold under our Preparedness Framework. We're previewing how we evaluated the model, how its safeguards have advanced alongside its capabilities, and what we'll continue to learn and improve. https://t.co/OrrTgdU90K

    推荐理由:原文给出了 Astra 与 GPT-5.6 Sol 在内部基准上的漏洞利用成功率与 token 效率对比,读者可据此判断这次网络安全能力跃升的幅度。

  11. @Alibaba_Qwen69

    通义千问将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T、上下文窗口 1M,已在 QwenCloud 上线 API。该版本在 Coding 与 Cowork 方向进一步后训练,官方称在复杂企业任务、科学研究和长周期工作流上表现更强。API 定价为每 100 万 token 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25。

    推荐理由:官方同时给出参数规模、1M 上下文与 API 定价,便于开发者评估长任务场景的接入成本。

  12. 机器之心 · 微信公众号84

    Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,缓存读取降价 75%

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,两者使用同一个底层模型,区别在于安全限制,Fable 5.1 面向普通用户、开发者和企业开放,Mythos 5.1 只提供给经过审核的高风险领域合作伙伴。

    推荐理由:新模型在科学研究型 Agent 基准上提升明显,缓存读取价格下调 75%,可据此判断 Agent 任务的成本变化。

  13. IT Home76

    Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两款模型采用相同基础模型,区别在于安全防护等级,Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经审核的网络安全和生命科学机构提供。

    推荐理由:两款同源模型以安全等级区分受众,基准与缓存降价的对比可供判断编程与知识工作的选型与成本。