NVIDIA 发布 Nemotron-Labs Diffusion 扩散语言模型系列
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。
推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。
IBM 发布两个 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2,基于 ModernBERT,覆盖 200+ 语言、32K token 上下文,并支持 9 种编程语言的代码检索。
推荐理由:两个模型以 Apache 2.0 覆盖 200+ 语言和 32K 上下文,读者可对照基准表判断小模型在多语言检索上的实际取舍。
AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。
推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。
IBM Granite 团队发布技术解读,说明 Granite 4.1 系列 3B、8B、30B 稠密模型基于约 15T token 的五阶段预训练流程构建,上下文窗口经长上下文扩展至 512K。
推荐理由:原文完整披露 Granite 4.1 的五阶段预训练数据配比与多阶段 RL 流程,可供同类小模型训练参考。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
作者基于 OpenAI 本周在 Hub 上开源的 Privacy Filter,用 gradio.Server 搭建了三个 PII 脱敏 Web 应用:文档高亮浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章以三个可运行示例展示 Privacy Filter 的接入方式,可供搭建 PII 脱敏应用时参考。
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
Hugging Face 发布指南,讲解如何在 Chrome 扩展(Manifest V3)中用 Transformers.js 运行本地模型,并复现其 Gemma 4 浏览器助手的核心架构。
推荐理由:用一个已上线的浏览器扩展拆解 MV3 下的分层架构,可供搭建本地模型扩展时参考分工与数据边界。