inclusionAI 发布万亿参数推理模型 Ring-2.6-1T
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
inclusionAI 在 Hugging Face 发布 Ming-flash-omni Preview,基于 Ling-Flash-2.0 稀疏 MoE 架构,总参数 100B、每 token 激活 6B。
推荐理由:原文给出稀疏 MoE 架构、生成式分割和方言语音识别等具体改进与评测数字,读者可对比其多模态能力变化。
Qwen-Image-2.1 by @Alibaba_Qwen just landed as the #1 open source model in the Image Edit Arena and Text-to-Image Arena! With 1367 pts in the Image Edit Arena, Qwen-Image-2.1 took the #1 spot among open. It landed #16 overall, just 3 pts from GPT-Image-1.5-high-fidelity at #15. See the leaderboard for the Text-to-Image arena below. Congrats to the @Alibaba_Qwen team on this contribution to the open source ecosystem!
推荐理由:官方确认 Qwen-Image-2.1 登顶两个图像 Arena 的开源榜首,榜单分数可用于同类模型的横向比较。
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。
Nathan Lambert 将其给美国国会的演讲稿整理为 2026 年开源权重模型现状综述,认为中国模型(GLM-5.3、Kimi K3 等)已明确领先美国开源模型,AAII 得分 45/44 对美国最佳 26,开源与闭源前沿差距约 2-5 个月。
推荐理由:作者以自建数据和演讲稿形式梳理中美开源权重模型的差距、采用与风险,读者可获得一份少见的系统性对比视角。
Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。
推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据规模 1 petabyte,超过 AlphaFold Database 30 倍以上。
推荐理由:官方平台发布,覆盖 90 亿个单核苷酸变异预测并附应用案例,可用于了解基因组变异数据资源的最新规模与获取方式。
Mistral 宣布完成 €3B Series D 融资,投后估值超过 €21B,为欧洲科技公司迄今最大规模股权融资,由三星电子领投,EQT 旗下 Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:原文是官方融资公告,给出了金额、估值、领投方和资金用途,读者可以据此了解 Mistral 下一阶段的扩张方向。
推荐理由:作者以当事方身份宣布收购并说明开源模型的价值,读者可据此理解这笔交易对开源生态的影响。
Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。
推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。
Hugging Face WebAI 团队发布 @huggingface/kernels 库,可从 Hub 加载和运行优化的 WebGPU 内核,首批提供 207 个内核,Apache-2.0 许可。
推荐理由:官方给出了与 ORT WebGPU 的对比数字和浏览器端众测入口,读者可据此评估浏览器本地推理的可用性。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
推荐理由:原文给出参数规模、与 GLM-5.2 的关系及基准表现,读者可据此评估是否切换到 GLM-5.3。
推荐理由:官方宣布权重开放并给出下载与博客入口,读者可以据此评估 GLM-5.3 在智能体编码场景的可用性。
推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。