Mistral 发布开源 MoE 模型 Mixtral 8x22B,141B 参数仅激活 39B
Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 总参数中仅激活 39B,并以 Apache 2.0 许可开放。
推荐理由:原文给出与主流开源模型在多语言、数学和编码基准上的对比,可用于评估同等推理预算下的性能取舍。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
当前仅显示精选新闻Mistral 发布开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 总参数中仅激活 39B,并以 Apache 2.0 许可开放。
推荐理由:原文给出与主流开源模型在多语言、数学和编码基准上的对比,可用于评估同等推理预算下的性能取舍。
Mistral AI 发布首个模型 Mistral 7B,采用 Apache 2.0 许可,称其在所有标准英文与代码基准上超过现有 13B 参数以下的开放模型。
推荐理由:官方在发布开源模型的同时给出路线图,并对比两年间 MMLU 60% 门槛上最小模型的参数变化。
Mistral AI 发布非生产许可 MNPL,允许开发者将模型用于非商业用途并支持研究工作,Codestral 也在该许可下发布。Mistral 表示会继续以 Apache 2.0 发布模型和代码,并将逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 用新许可划出商用与非商用的边界,开发者可据此判断使用其模型的合规范围。
Mistral 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最多 128k token 上下文,基座与指令微调权重均以 Apache 2.0 许可开源。
推荐理由:Mistral NeMo 以 Apache 2.0 开源并支持 128k 上下文,读者可借基准表判断它与同尺寸开源模型的位置。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的 7B 指令代码模型,权重已在 HuggingFace 开放,采用 Apache 2.0 许可。
推荐理由:Mamba 架构带来线性时间推理与长序列建模,官方还测试了 256k token 的上下文检索,为代码助手的本地部署提供 Transformer 之外的选择。
Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。
推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,总参数 46.7B,每个 token 只激活 12.9B 参数。
推荐理由:官方给出与 Llama 2 70B、GPT-3.5 的逐项基准对比,可据此判断稀疏 MoE 开放权重的性价比。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 开放权重模型,支持 80 多种编程语言、32k 上下文窗口,并通过 fill-in-the-middle 机制补全代码、编写测试。
推荐理由:22B 开放权重代码模型给出 32k 上下文与多语言基准对照,可据此判断自部署代码补全的取舍。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图片。
推荐理由:官方在同一测试框架下给出与 GPT-4o、Gemini-1.5 Pro 的多模态基准对比,可据此看开放权重模型的当前位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在全部评测上超过 Llama 2 13B,多项基准接近 Llama 1 34B。该模型采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在 16k 序列长度、4k 窗口下推理提速 2x,并能在 8192 序列长度下节省一半缓存。
推荐理由:官方给出与 Llama 2 系列同评估管线的对比和 Apache 2.0 授权,便于判断同尺寸模型的选型空间。
LangChain 的 Deployed Engineer 介绍了其为 Kubernetes 部署构建的自主 SRE 智能体,目标是缩短故障排查与修复时间。
推荐理由:LangChain 公开了自建 SRE 智能体的架构取舍,读写分离与人工审批门的设计可迁移到其他生产运维场景。
LangChain 发布 Deep Agents v0.7,通过删除底层基础系统提示词、裁剪 43% 内置工具描述并把 TodoListMiddleware 改为可选,默认智能体单轮的基础输入 token 减少 65%(约 6k 降至约 2k)。
推荐理由:发布给出了删减提示词后的 token 与成本对比数据,可用来判断精简 harness 对现有智能体工作流的影响。
Anthropic 发布新论文,称 Claude 在训练中自发形成了一小簇内部神经模式,命名为 J-space,其作用类似神经科学中的全局工作空间,承载模型没有说出口的内部想法。
推荐理由:论文给出了读取模型未说出口内部表征的方法,并演示干预这些表征如何改变推理与安全表现。
机器之心解读了 DeepSeek Harness 背后的八十页论文《A Programming Paradigm for Spatiotemporal Composability》。
推荐理由:文章把八十页论文里的效应与余效应机制讲成运行时插件的卸载设计,便于理解自修改智能体如何干净回收组件。
Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。
推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。
DeepSeek 于 8 月 13 日发布首个 Harness 版本 DSH,以 MIT 协议开源在 GitHub 上,仓库版本号仍停留在 0.1.0-rc,官方称其为开发者预览版且未来会出现破坏兼容性的变更。
推荐理由:从插件化架构与开源生态两个角度拆解 DSH,帮助读者理解 DeepSeek 把 Harness 探索交给社区的思路。
智谱正式发布 GLM-5.3,基座模型与 GLM-5.2 相同,全部提升来自后训练 Scaling,官方称其为编程能力最强的开源模型,内部自建体感评测较 GLM-5.2 提升 50%。
推荐理由:GLM-5.3 在基座不变的前提下靠后训练 Scaling 推高编程与智能体基准,权重将在两周后开放。
DeepSeek 在 8 月 13 日晚发布 DeepSeek Harness v0.1 开发者预览版,采用 MIT 协议开源,用 npx @deepseek-ai/dsh web 即可在本地浏览器启动。
推荐理由:文章以一夜实测加插件生态盘点,对比 Claude Code 的封闭外壳路线,呈现 harness 被开源后的竞争变化。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告。Hub 公开模型仓库从 243 万增至 296 万,数据集突破 100 万;中国实验室在几乎所有月份的最大开源模型参数都超过美国实验室,754B 至 2.78 万亿参数,而 Qwen 衍生模型达 151,448 个,成为社区主要基座。
推荐理由:Hugging Face 官方半年报用 Hub 数据拆解开源模型格局,涵盖中美发布规模、下载与关注背离、Qwen 生态地位和 Agent 流量。
DeepSeek Harness 正式发布并开源,作者内测半个月后把自己的 Vibe Coding 项目从 Codex 迁移到 DSH。DSH 采用一切皆插件的 Cordis 架构,内置 100 多个插件,提供标准、PTC、极简、创造四类 Agent 预设,并有可直接查看原始事件的轨迹回放视图。
推荐理由:作者用半个月内测体验对比 Codex,呈现 DSH 的插件化架构与轨迹回放等设计,便于判断它与现有编码 Agent 的差异。