Xiaomi MiMo-V2.6-Pro 1T-A42B 发布,以约 300 万美元训练成本登顶开源权重模型
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
来自 @inteldevs 的 Day-0 OpenVINO 支持!🥳 Qwen-Image-2.1 已可在 Intel 硬件上优化运行。一个开放权重 checkpoint,同时支持生成和编辑。👇
We're excited to offer Day0 OpenVINO support for Qwen-Image-2.1 Read more about what you can accomplish here: https://ms.spr.ly/6019a5nm5
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是加快开发并更好引导贡献者。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被不同引擎使用的 MLX 参考实现。
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。
Nathan Lambert 将其给美国国会的演讲稿整理为 2026 年开源权重模型现状综述,认为中国模型(GLM-5.3、Kimi K3 等)已明确领先美国开源模型,AAII 得分 45/44 对美国最佳 26,开源与闭源前沿差距约 2-5 个月。
推荐理由:作者以自建数据和演讲稿形式梳理中美开源权重模型的差距、采用与风险,读者可获得一份少见的系统性对比视角。
Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。
Latent Space AINews 汇总 9/17-9/18 AI 动态:Jev 决策模型发布视频两天获 36M views,因未开源引发多个克隆,包括 Bespoke Nimble(Qwen3.5-9B 的 LoRA 微调。
Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。
推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。
Mistral 宣布与 Mozilla 合作,Firefox 的 AI 浏览助手 Smart Window (beta) 现由 Mistral 模型驱动,先覆盖法国和北美,英国和德国预计今年晚些时候跟进。双方强调开源与本地化,模型针对地区语言、方言和文化语境微调;Smart Window 默认不在 Mozilla 服务器保存对话,Mistral 承诺零数据保留。
Viggle 宣布开源 viggle-animate 模型,可将任何人替换进任意视频中,同时提供在线快速试用版本。试用入口为 https://viggle.ai/meme/app/animate。
We Must Pace the Frontier
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.5-122B-A10B 上的内在流式安全护栏探针,复用基座模型隐藏状态,在每个 token 上输出 8 类查询意图、回复不安全度和幻觉风险分数,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 隐藏状态的流式安全探针,可在生成过程中逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-397B-A17B 的流式安全探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.8-27B-singprobe,这是一个构建在 Qwen/Qwen3.8-27B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
Interconnects 作者 Nathan Lambert 公布一份开放模型研究书单,覆盖开放模型战略、中美竞争、技术细节与蒸馏争议等主题,并承诺持续更新。书单收录 Mark Zuckerberg、Irene Solaiman、SemiAnalysis、Kevin Xu 等人的文章与论文,并指出当前开源与闭源模型的差距约为 4-6 个月,2024 年前后领先的开放模型均来自中国实验室。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。
Hugging Face 团队用 gr.Workflow 将 AUTOMATIC1111 的主要功能重建为 Workflow1111,画布包含 11 条媒体管线。
推荐理由:原文拆解了 11 条媒体管线和 73 个节点的具体构成,展示了 Gradio Workflow 混搭多模型并自动生成 REST 与 MCP 端点的做法。
🤗 Novita now supports Ling-3.0-flash-VL on @huggingface. 🎁 Free for 14 days. • 124B total parameters · 5.5B active parameters per token • Native image and video understanding • Built for multimodal reasoning and agentic workflows
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。
智谱 GLM-5.3 从 MIT 转为自定义许可证,要求年收入超 100 亿美元的模型服务商通过 Z.AI 安全审查,但许可证未定义"关联方"。本期还收录 Motif-3(MIT 许可)、腾讯 Hy4-preview、Qwen3.8-Flash-Next(125B-A6B)等新模型。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据规模 1 petabyte,超过 AlphaFold Database 30 倍以上。
推荐理由:官方平台发布,覆盖 90 亿个单核苷酸变异预测并附应用案例,可用于了解基因组变异数据资源的最新规模与获取方式。
Mistral 宣布完成 €3B Series D 融资,投后估值超过 €21B,为欧洲科技公司迄今最大规模股权融资,由三星电子领投,EQT 旗下 Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:原文是官方融资公告,给出了金额、估值、领投方和资金用途,读者可以据此了解 Mistral 下一阶段的扩张方向。
H Company 发布 NeoMME 系列多语言多模态编码器,有 260M 和 800M 两种规格,用单个双向 Transformer 从头训练处理文本 token 和 32×32 图像 patch,不依赖预训练视觉塔或因果语言模型。
推荐理由:作者以当事方身份宣布收购并说明开源模型的价值,读者可据此理解这笔交易对开源生态的影响。
Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。
推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。
Hugging Face 博客用 TRL 和 OpenEnv 开放复现 Surya Narreddi 让语言模型写 p5.brush JavaScript 画水彩的方法,训练 Qwen/Qwen3.5-35B-A3B,参考池、RL 环境、训练脚本和模型全部公开,一条命令即可在 HF 上端到端运行。
Hugging Face WebAI 团队发布 @huggingface/kernels 库,可从 Hub 加载和运行优化的 WebGPU 内核,首批提供 207 个内核,Apache-2.0 许可。
推荐理由:官方给出了与 ORT WebGPU 的对比数字和浏览器端众测入口,读者可据此评估浏览器本地推理的可用性。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,均以 Apache 2.0 许可开源。
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。