最新开源模型盘点第 24 期:Motif-3、GLM-5.3、Hy4-preview 与开源模型许可证
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
Muse Spark 1.3 现已支持 max reasoning,可在 Muse Code 和 Meta Model API 上使用 👇
1/ we just publicly released Muse Spark 1.3 max! we see significantly stronger coding and agentic performance on muse spark 1.3 max, so would strongly recommend trying it out even if you've already tried muse spark 1.3 high or muse spark 1.3 xhigh.
Microsoft 于 9 月 4 日发布 MAI-Image-2.6,并面向 Microsoft Foundry 开发者推出低延迟版本 MAI-Image-2.6-Flash。
推荐理由:原文来自官方发布,给出排名、速度和价格效率数据,读者可据此评估两个版本在生产场景中的取舍。
Microsoft MAI 发布转写模型 MAI-Transcribe-2,在 FLEURS 基准 60 种语言上以平均词错率 5.2% 排名第一,定价每小时音频 $0.10(年底前限时)。
H Company 发布 NeoMME 系列多语言多模态编码器,有 260M 和 800M 两种规格,用单个双向 Transformer 从头训练处理文本 token 和 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型。


Introducing Gemini 3.8 Flash, another jump in Gemini's agentic + coding capabilities, and our 3rd updated Flash model in only 6 weeks... This model has been a ton of fun to work with, excited to see what you all think!
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。
推荐理由:官方给出具体基准数据和定价,可用于对比 3.7 Flash 判断升级性价比,Cyber 版的开放范围也值得安全团队留意。
Google 发布 8 月 AI 更新盘点,推出面向编程与智能体的 Gemini 3.7 Flash,其每百万 token 价格为首发时 3.6 Flash 的一半;同时发布语音转文本模型 Gemini 3.5 Transcribe 和搭载 Tensor G6、运行 Gemini Nano 的 Pixel 11 系列。
Introducing Atlas: The world's first multimodal world model that generates image and video frames with pixel-perfect camera control and reconstructs them in 3D. Model the world, move the camera, and simulate space & time.
Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。
推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。
Google 发布 TimesFM-3,一个 330M 参数、在超过 1 万亿时间点上预训练的时间序列基础模型,原生支持零样本多变量预测。模型可在单次前向传播中生成整个预测区间,支持多目标、过去协变量和过去-未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个基准上于点预测和概率预测指标中均排名第一。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型、安全防护级别不同,Fable 5.1 全面开放,Mythos 5.1 限可信访问计划。
推荐理由:原文给出新旧模型基准对比、cache reads 降价幅度和访问政策变化,读者可据此评估升级成本与适用场景。
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。
推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
推荐理由:原文给出参数规模、与 GLM-5.2 的关系及基准表现,读者可据此评估是否切换到 GLM-5.3。
推荐理由:官方宣布权重开放并给出下载与博客入口,读者可以据此评估 GLM-5.3 在智能体编码场景的可用性。
更多好消息:GLM-5.3 的权重将于明天发布。 https://huggingface.co/zai-org/GLM-5.3
推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
Meta 发布自研训练加速器 MTIA 300,专为排序与推荐模型训练优化,是 MTIA 家族首款训练芯片。
一家新实验室认为 AI 文风千篇一律是训练问题,并据此推出了一款专注写作的模型。实测显示,它生成的文字更难预测,但质量未必更好。作者称主要实验室在写作上的模型进展已停滞,而 OpenAI、Anthropic、Google 或更侧重编程方向。
DeepSeek 在 API 平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,通过设置 model='deepseek-v4-flash-vision-exp' 即可调用。
推荐理由:官方公布了多模态 Agent 基准成绩和调用方式,读者可据此判断其视觉 Agent 能力在现有模型中的位置。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
推荐理由:原文交代了 GLM-5.3 的能力侧重、基准分数和开放节奏,读者可以据此判断其在开源与闭源模型中的位置。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
Microsoft 发布首个 cyber 模型 MAI-Cyber-1-Flash,为源自 MAI-Thinking-1 的紧凑代码安全模型,可处理约 90% 的任务,让 MDASH 把 GPT-5.4 留给最难的 10% 任务,相比现有最佳组合节省 50% 成本。
推荐理由:原文给出 Gemini 3.7 Flash 的降价幅度和三项能力改进方向,并列出可用渠道,读者可快速了解这版更新。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。
推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。
Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。
推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。
Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。