Mistral AI 发布 Mixtral 8x7B 稀疏 MoE 开放权重模型
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,总参数 46.7B,每个 token 只激活 12.9B 参数。
推荐理由:官方给出与 Llama 2 70B、GPT-3.5 的逐项基准对比,可据此判断稀疏 MoE 开放权重的性价比。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
当前仅显示精选新闻Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,总参数 46.7B,每个 token 只激活 12.9B 参数。
推荐理由:官方给出与 Llama 2 70B、GPT-3.5 的逐项基准对比,可据此判断稀疏 MoE 开放权重的性价比。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 开放权重模型,支持 80 多种编程语言、32k 上下文窗口,并通过 fill-in-the-middle 机制补全代码、编写测试。
推荐理由:22B 开放权重代码模型给出 32k 上下文与多语言基准对照,可据此判断自部署代码补全的取舍。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图片。
推荐理由:官方在同一测试框架下给出与 GPT-4o、Gemini-1.5 Pro 的多模态基准对比,可据此看开放权重模型的当前位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在全部评测上超过 Llama 2 13B,多项基准接近 Llama 1 34B。该模型采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在 16k 序列长度、4k 窗口下推理提速 2x,并能在 8192 序列长度下节省一半缓存。
推荐理由:官方给出与 Llama 2 系列同评估管线的对比和 Apache 2.0 授权,便于判断同尺寸模型的选型空间。
Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。
Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。
推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。
inclusionAI 发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数 5.1B,在关键基准上追平或超过上一代 1T 级旗舰 Ring-2.6-1T。
推荐理由:模型卡给出混合线性注意力架构与多精度量化对比,读者可据此评估长上下文智能体任务的部署成本。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
智谱正式发布 GLM-5.3,基座模型与 GLM-5.2 相同,全部提升来自后训练 Scaling,官方称其为编程能力最强的开源模型,内部自建体感评测较 GLM-5.2 提升 50%。
推荐理由:GLM-5.3 在基座不变的前提下靠后训练 Scaling 推高编程与智能体基准,权重将在两周后开放。
推荐理由:原文给出 Gemini 3.7 Flash 的降价幅度和三项能力改进方向,并列出可用渠道,读者可快速了解这版更新。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
FireRedTeam 发布 FireRedTTS3 的 PyTorch 代码与模型,基于语义增强连续语音表示,统一语音生成与编辑,含 Base 和 Instruct 两个变体,采用 Apache-2.0 许可。
推荐理由:仓库给出完整评测数字和安装使用入口,读者可以据此评估它在多语言克隆和语音编辑上的实际表现。
DeepSeek 正式开源 DeepSeek-V4-Pro-0813,同时推出基于 Cordis 的开源代码智能体框架 Harness v0.1 开发者预览版,并同步开放配套插件生态。
推荐理由:原文列出 Harness 的插件式架构与四种默认模式,可用于比较它与 Codex、Claude Cowork 的工具组织方式。
推荐理由:发布方直接给出 Agent 能力升级、可调推理档位和 OpenAI Responses API 兼容,读者可对照判断是否切换日常模型。
DeepSeek 发布 DeepSeek V4 Pro 正式版,已同步在 APP、网页端和 API 上线,官方称其 Agent 能力增强,网页端和 APP 可选择“专家模式”使用。
推荐理由:正文给出 Agent 能力提升、三档思考强度和峰谷定价,可供读者评估 API 成本与任务调度。
inclusionAI 发布 Ling-3.0-flash 原生混合线性推理模型,总参数 124B、激活 5.1B,官方称其关键基准上追平或超过前代 1T 级旗舰 Ring-2.6-1T。
推荐理由:官方给出 124B 总参数、5.1B 激活的架构与量化评测数据,可供判断长上下文推理的部署成本。
inclusionAI 发布原生混合推理模型 Ling-3.0-flash,总参数 124B、每 token 激活 5.1B,约为前代 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%。
推荐理由:模型卡给出混合线性注意力架构与 5.1B 激活参数占比,并附 SGLang、vLLM 部署命令,便于对照前代旗舰评估效率取舍。
MiniMax 发布开放权重音乐生成模型 Music 3.0,可基于创意描述和可选歌词一次性完成最长五分钟完整歌曲的作曲、编曲与制作。
推荐理由:原文给出架构细节和三方面能力升级,读者可以了解其开放权重音乐模型的技术路径。
DeepSeek 最新 Pro 模型 DeepSeek V4 Pro 0813 已通过 API 上线,作者因找不到官方发布页面而链接到 OpenRouter;随后更新称权重已在 Hugging Face 开放,1.7T 参数、893 GB。
推荐理由:记录了新模型仅以 API 形式上线、权重随后开放至 Hugging Face,以及作者自测不同推理档位的输出差异。
DeepSeek V4 Pro 正式版发布,API 平台已上线 DeepSeek-V4-Pro-0813,官方博客尚未发布。在 HLE、Terminal Bench、Cybergym、DeepSWE 等 Agent 基准上,它几乎全面超过 Opus 4.8,逼近 Fable 5,部分榜单反超;百万 tokens 输入 3 元、缓存命中 0.025 元、输出 6 元。
推荐理由:素材给出多项 Agent 基准对比与 API 定价,可据此判断国产开源模型与闭源前沿的差距及调用成本。