Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
推荐理由:原文给出 DeepSeek-V4.1-Flash 的参数结构、上下文长度和开源协议,读者可据此评估其部署与成本价值。
OpenAI 在 API 中推出语音模型 GPT‑Live‑1,支持自然的全双工语音对话。模型具备更强的指令遵循能力,支持自定义音色和电话场景。
推荐理由:官方摘要指出模型新增全双工语音、自定义音色和电话支持,可据此了解 API 语音能力的扩展方向。
DeepSeek 正式发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸模型,具备原生多模态视觉理解能力,设计目标是能力上限更高、推理更快、吞吐更大。
推荐理由:官方公布了新结构系列最小模型的多项基准成绩和 API 迁移方式,开发者可据此评估切换成本与价格变化。
OpenAI 发布 GPT-6 Astra,称其为面向商务的最强模型,具备高级推理、电脑使用能力,以及更强的写作和设计判断。
推荐理由:官方宣布新模型并点出推理、电脑操作与写作设计判断等方向,可据此了解其在商务场景的定位。
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。
推荐理由:官方给出具体基准数据和定价,可用于对比 3.7 Flash 判断升级性价比,Cyber 版的开放范围也值得安全团队留意。
Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。
推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型、安全防护级别不同,Fable 5.1 全面开放,Mythos 5.1 限可信访问计划。
推荐理由:原文给出新旧模型基准对比、cache reads 降价幅度和访问政策变化,读者可据此评估升级成本与适用场景。
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。
推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。
推荐理由:原文给出参数规模、与 GLM-5.2 的关系及基准表现,读者可据此评估是否切换到 GLM-5.3。
推荐理由:官方宣布权重开放并给出下载与博客入口,读者可以据此评估 GLM-5.3 在智能体编码场景的可用性。
推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
DeepSeek 在 API 平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,通过设置 model='deepseek-v4-flash-vision-exp' 即可调用。
推荐理由:官方公布了多模态 Agent 基准成绩和调用方式,读者可据此判断其视觉 Agent 能力在现有模型中的位置。
推荐理由:原文交代了 GLM-5.3 的能力侧重、基准分数和开放节奏,读者可以据此判断其在开源与闭源模型中的位置。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
推荐理由:原文给出 Gemini 3.7 Flash 的降价幅度和三项能力改进方向,并列出可用渠道,读者可快速了解这版更新。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。