最新精选
第 181–200 条 · 共 202 条- Hugging Face Blog精选AI 评分6060
Hugging Face 发布教程,介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行。作者为 Trackio 搭建的方案只需把 runs-on 改成 hf-jobs-* 标签,CPU CI 耗时从 GitHub 托管的 1m40s 降到 1m10s,GPU 测试在 t4-small 上 45 秒跑完、成本不到 1 美分。
推荐理由:文中给出从 GitHub Actions 迁移到 HF Jobs 的完整步骤和实测耗时对比,可供需要 GPU CI 的 ML 项目参考。
- Hugging Face Blog精选AI 评分6161
OpenEnv 宣布由 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk 组成的委员会共同协调,项目地址迁移至 huggingface/OpenEnv。
推荐理由:OpenEnv 由多家机构组成的委员会共同协调,并明确为 RL 环境的互操作层,读者可了解开源智能体训练的协作与协议设计。
- Hugging Face Blog精选AI 评分6666
NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。
推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。
- Hugging Face Blog精选AI 评分6969
Hugging Face 将官方命令行入口 hf CLI 重构为同时服务人类与编码智能体的工具,agent 模式下自动输出 TSV、不截断数据,并附带可直接执行的下一步命令提示。
推荐理由:官方给出 hf CLI 智能体模式的设计与基准数据,读者可据此了解编码 agent 调用 Hub 时的 token 开销差异。
谷歌DeepMind发布并开源Gemma 4 12B,这是一个统一、无编码器的多模态模型,只需16GB显存或统一内存即可在消费级笔记本上运行。它在标准评测基准上的成绩接近26B MoE模型,总内存占用不到后者一半,采用Apache 2.0协议,预训练与指令微调权重可从Hugging Face和Kaggle下载。
推荐理由:原文介绍了无编码器多模态架构如何降低延迟和内存占用,并列出16GB笔记本可用的本地运行入口。
- G@googleaidevs@googleaidevs精选AI 评分7878
Google 公布 Gemma 4 模型权重,可在 Kaggle 和 Hugging Face 下载。该模型兼容 llama.cpp、MLX、LM Studio、vLLM、Ollama、Unsloth 和 SGLang,权重集合位于 huggingface.co/collections/google/gemma-4。
推荐理由:内容列出了 Gemma 4 的下载渠道与兼容工具链,便于判断本地部署和微调的可选路径。
- Hugging Face Blog精选AI 评分7272
H 公司发布 Holo3.1 计算机使用智能体模型家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次推出 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 在移动端与跨框架适配上补齐短板,量化权重把计算机使用智能体带到本地设备。
- Hugging Face Blog精选AI 评分8080
NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。
推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。
- Hugging Face Blog精选AI 评分6262
Hugging Face 博客发布 PyTorch profiling 系列第一篇,以矩阵乘法加加法为例讲解 torch.profiler 的用法。文章说明 profiler 会导出统计表格和 Perfetto 时序 trace 两类产物,并演示如何用 warmup 消除冷启动开销、区分 CPU 与 GPU lane 以及读懂嵌套的调度链,最后附上速查表。
推荐理由:面向初学者的 torch.profiler 阅读指南,用两个矩阵算子串起从 CPU 调度到 CUDA 内核的完整链路,并附上速查表。
- Hugging Face Blog精选AI 评分6868
Artificial Analysis 与 IBM 软件创新实验室发布 ITBench-AA,这是首个面向智能体企业 IT 任务的基准系列,首批聚焦 SRE 场景,前沿模型得分均低于 50%。
推荐理由:前沿模型在这套企业IT智能体基准上全部低于50%,并给出开源权重模型的每任务成本对照,可作为能力与成本参照。
- Hugging Face Blog精选AI 评分6666
Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。
推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。
- Hugging Face Blog精选AI 评分6262
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。
- Hugging Face Blog精选AI 评分6969
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
- Hugging Face Blog精选AI 评分7575
IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。
推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。
- Hugging Face Blog精选AI 评分6363
IBM 发布两个 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2,基于 ModernBERT,覆盖 200+ 语言、32K token 上下文,并支持 9 种编程语言的代码检索。
推荐理由:两个模型以 Apache 2.0 覆盖 200+ 语言和 32K 上下文,读者可对照基准表判断小模型在多语言检索上的实际取舍。
- Hugging Face Blog精选AI 评分6565
AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。
推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。
- Hugging Face Blog精选AI 评分6161
IBM Granite 团队发布技术解读,说明 Granite 4.1 系列 3B、8B、30B 稠密模型基于约 15T token 的五阶段预训练流程构建,上下文窗口经长上下文扩展至 512K。
推荐理由:原文完整披露 Granite 4.1 的五阶段预训练数据配比与多阶段 RL 流程,可供同类小模型训练参考。
- Hugging Face Blog精选AI 评分8080
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
- inclusionAI Hugging Face models精选AI 评分6262
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
- Hugging Face Blog精选AI 评分6060
作者基于 OpenAI 本周在 Hub 上开源的 Privacy Filter,用 gradio.Server 搭建了三个 PII 脱敏 Web 应用:文档高亮浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章以三个可运行示例展示 Privacy Filter 的接入方式,可供搭建 PII 脱敏应用时参考。