跳到正文

#Hugging Face

今日 1 条
今天10月2日周五
  1. Hugging Face Blog43

    AutoSynthData:为 Enterprise Agents 生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。

10月1日周四
9月30日周三
9月29日周二
  1. Hugging Face Blog49

    Hugging Face 发布 ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。

9月28日周一
  1. Hugging Face Blog75

    H Company 发布 Holo4 系列通用计算机操作智能体模型

    H Company 发布 Holo4 智能体模型系列,包含 27B dense 和 35B-A3B MoE 两个尺寸,并附带基于 Nemotron 3 Nano Omni 后训练的 Holotron4 Nano。

    推荐理由:官方发布给出了跨 GUI、代码、MCP 和 API 四类接口的统一智能体模型,附基准分数和完整轨迹数据,适合评估开源方案与闭源模型的成本差距。

9月24日周四
9月22日周二
  1. Hugging Face Blog48

    oMLX 创作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是加快开发并更好引导贡献者。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被不同引擎使用的 MLX 参考实现。

9月21日周一
  1. Hugging Face Blog57

    Hugging Face tokenizers v1 发布候选,编码速度较 v0.23 提升最多 30 倍

    Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。

9月16日周三
  1. Hugging Face Blog63

    IBM Research 为 ALTK-Evolve 推出 Consistency Analyzer,将智能体一致性缺口从 24.4pp 降到 12.0pp

    IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。

    推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。

9月14日周一
9月10日周四
9月3日周四
  1. Hugging Face Blog65

    用 TRL 和 GRPO 微调 LFM2.5-350M,100 步提升 IFStruct 结构化输出成绩

    Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。

    推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。

  2. Hugging Face Blog69

    Hugging Face 发布开源工具 funes,为编码 Agent 提供本地自有记忆层

    Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。

    推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。

9月2日周三
  1. Hugging Face Blog52

    Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力

    Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。

9月1日周二
8月28日周五
8月26日周三
  1. Hugging Face Blog74

    Sentence Transformers 教程:用 MultiVectorEncoder 训练与微调多向量嵌入模型

    Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。

    推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。

8月25日周二
  1. Hugging Face Blog63

    IBM 发布 Granite 4.2 推理模型家族并详解构建过程

    IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。

    推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。

  2. Hugging Face Blog69

    Gradio 推出 gr.Workflow:把 AI 管线变成可拖拽、可部署的节点图

    Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。

    推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。

8月21日周五
  1. Hugging Face Blog64

    Hugging Face 解析 Papers with Code 搜索背后的 Inference Endpoints、Jobs 与 Buckets 架构

    Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。

    推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。

  2. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月11日周二
8月10日周一
  1. Hugging Face Blog81

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。

    推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。