推荐理由:内容列出了 Gemma 4 的下载渠道与兼容工具链,便于判断本地部署和微调的可选路径。
Hugging Face
全部主题Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
最新精选
第 141–157 条 · 共 158 条@googleaidevs@googleaidevs精选AI 评分7878
Hugging Face Blog精选AI 评分7272 H 公司发布 Holo3.1 计算机使用智能体模型,推出本地量化权重
H 公司发布 Holo3.1 计算机使用智能体模型家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次推出 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 在移动端与跨框架适配上补齐短板,量化权重把计算机使用智能体带到本地设备。
Hugging Face Blog精选AI 评分8080 NVIDIA 发布 Cosmos 3:首个面向物理 AI 推理与动作的开源全模态模型
NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。
推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。
Hugging Face Blog精选AI 评分6262 PyTorch 性能分析(一):torch.profiler 入门指南
Hugging Face 博客发布 PyTorch profiling 系列第一篇,以矩阵乘法加加法为例讲解 torch.profiler 的用法。文章说明 profiler 会导出统计表格和 Perfetto 时序 trace 两类产物,并演示如何用 warmup 消除冷启动开销、区分 CPU 与 GPU lane 以及读懂嵌套的调度链,最后附上速查表。
推荐理由:面向初学者的 torch.profiler 阅读指南,用两个矩阵算子串起从 CPU 调度到 CUDA 内核的完整链路,并附上速查表。
Hugging Face Blog精选AI 评分6868 Artificial Analysis 与 IBM 发布 ITBench-AA 基准,前沿模型在智能体企业 IT 任务上得分不足 50%
Artificial Analysis 与 IBM 软件创新实验室发布 ITBench-AA,这是首个面向智能体企业 IT 任务的基准系列,首批聚焦 SRE 场景,前沿模型得分均低于 50%。
推荐理由:前沿模型在这套企业IT智能体基准上全部低于50%,并给出开源权重模型的每任务成本对照,可作为能力与成本参照。
Hugging Face Blog精选AI 评分6666 TRL 推出 Delta Weight Sync,异步 RL 每步权重传输从 1.2GB 降至 20-35MB
Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。
推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。
Hugging Face Blog精选AI 评分6262 Hugging Face 让 Reachy Mini 完全本地运行语音对话
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。
Hugging Face Blog精选AI 评分6969 NVIDIA 发布 Nemotron-Labs Diffusion 扩散语言模型系列
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
Hugging Face Blog精选AI 评分7575 IBM Research 发布 Open Agent Leaderboard 与 Exgentic 评测框架
IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。
推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。
Hugging Face Blog精选AI 评分6363 IBM 发布 Granite Embedding Multilingual R2 多语言嵌入模型,支持 32K 上下文
IBM 发布两个 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2,基于 ModernBERT,覆盖 200+ 语言、32K token 上下文,并支持 9 种编程语言的代码检索。
推荐理由:两个模型以 Apache 2.0 覆盖 200+ 语言和 32K 上下文,读者可对照基准表判断小模型在多语言检索上的实际取舍。
Hugging Face Blog精选AI 评分6565 AI2 发布 EMO:预训练混合专家实现涌现模块化
AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。
推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。
Hugging Face Blog精选AI 评分6161 IBM 详解 Granite 4.1 大模型的预训练与强化学习流程
IBM Granite 团队发布技术解读,说明 Granite 4.1 系列 3B、8B、30B 稠密模型基于约 15T token 的五阶段预训练流程构建,上下文窗口经长上下文扩展至 512K。
推荐理由:原文完整披露 Granite 4.1 的五阶段预训练数据配比与多阶段 RL 流程,可供同类小模型训练参考。
Hugging Face Blog精选AI 评分8080 NVIDIA 发布 Nemotron 3 Nano Omni 长上下文多模态模型
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 发布 DR-Venus-4B-SFT 深度研究智能体模型
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
Hugging Face Blog精选AI 评分6060 如何用 OpenAI Privacy Filter 构建可扩展 Web 应用
作者基于 OpenAI 本周在 Hub 上开源的 Privacy Filter,用 gradio.Server 搭建了三个 PII 脱敏 Web 应用:文档高亮浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章以三个可运行示例展示 Privacy Filter 的接入方式,可供搭建 PII 脱敏应用时参考。
Hugging Face Blog精选AI 评分8080 DeepSeek-V4 发布:百万 token 上下文面向智能体任务
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
Hugging Face Blog精选AI 评分6767 如何在 Chrome 扩展中用 Transformers.js 运行本地 Gemma 4 模型
Hugging Face 发布指南,讲解如何在 Chrome 扩展(Manifest V3)中用 Transformers.js 运行本地模型,并复现其 Gemma 4 浏览器助手的核心架构。
推荐理由:用一个已上线的浏览器扩展拆解 MV3 下的分层架构,可供搭建本地模型扩展时参考分工与数据边界。