Hugging Face 模型页上线 Every Eval Ever 评测结果
Hugging Face 将 Every Eval Ever(EEE)与 Community Evals 打通,EEE 评测结果可直接提交至 Community Evals,并显示在模型页与基准排行榜上,同时通过 Source EvalEval 徽章回链完整 JSON 记录。
huggingface.co · 网站与博客
Hugging Face 将 Every Eval Ever(EEE)与 Community Evals 打通,EEE 评测结果可直接提交至 Community Evals,并显示在模型页与基准排行榜上,同时通过 Source EvalEval 徽章回链完整 JSON 记录。
DiScoFormer 用一个 Transformer 在一次前向传播中同时估计分布的密度与分数,无需针对新分布重新训练。模型以高斯混合模型(GMM)作为训练目标,利用密度与分数(log-density 的梯度)的数学关系共享主干并设两个输出头。
在 HF Jobs 上用一条命令即可运行 vLLM,获得私有、按秒计费的 OpenAI 兼容端点。端点通过 HF token 鉴权,可用 curl 或 Python OpenAI 客户端调用;文章还给出 SSH 调试、Gradio 对话和作为 Pi 编码智能体后端的配置,并对比 HF Jobs 与 Inference Endpoints 的适用场景。
推荐理由:用一条命令在 HF Jobs 上部署 vLLM 端点,并给出从查询到接入编码智能体的完整配置路径。
艾伦人工智能研究所(AI2)用 7B 的 Olmo 3 与 Olmo Hybrid 逐 token 对比,发现混合模型在承载语义的实词(名词、动词、形容词)上损失差距约 0.04,在虚词上约 0.02,优势最大;但在闭括号和逐字重复输入内容的 token 上优势几乎消失,后者正是 transformer 的强项。
NVIDIA 发布 NeMo AutoModel 开源库,基于 Transformers v5,在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B A3B 微调中实现 3.4 至 3.7 倍训练吞吐提升与 29% 至 32% 显存下降,只需改动一行 import。
推荐理由:只需改动一行 import,MoE 微调吞吐即可提升 3.4 至 3.7 倍、显存降低 29% 至 32%,读者可据此判断迁移成本。
Treble Technologies 与 Hugging Face 推出 FFASR 榜单,称其为首个开放的远场 ASR 基准,在 14 个仿真房间和不同信噪比条件下评测语音识别模型。榜单同时报告 WER 与 RTFx,现有提交显示低 SNR 下的远场 WER 普遍是近场 WER 的数倍。用户可在 Submit 页粘贴 Hugging Face 模型 ID,评测在服务端对留出数据集运行。
推荐理由:新榜单将近场与远场语音识别的性能差距量化并公开,读者可据此判断模型在真实部署声学环境下的鲁棒性。
IBM 开源了 CUGA(Configurable Generalist Agent)智能体框架,并发布 cuga-apps 项目,内含 24 个单文件 FastAPI 智能体应用示例。
推荐理由:原文给出可直接克隆的 24 个单文件智能体应用模板,并拆解工具与提示词的复用写法。
Transformers.js 通过 PR #1549 引入实验性 Cross-Origin Storage(COS)缓存后端,需在首次 pipeline 调用前设置 env.experimental_useCrossOriginStorage = true。
huggingface_hub 将发布周期从每 4 到 6 周一次缩短到每周一次,用 GitHub Actions 编排整个流程,由开源权重模型起草 release notes 和 Slack 公告,再由人工审核后发布。
推荐理由:原文公开了发版工作流的信任校验循环,读者可据此把模型起草加确定性校验的方法迁移到自己的项目。
PaddleOCR 发布 PP-OCRv6 通用 OCR 模型家族,提供 tiny、small、medium 三档,参数从 1.5M 到 34.5M,其中 medium 在官方多场景基准上达到 86.2% 检测 Hmean 和 83.2% 识别准确率。
推荐理由:PP-OCRv6 给出三档参数与多后端入口,读者可据此比较轻量 OCR 在各自部署场景中的取舍。
Hugging Face 博客展示了用本地模型对 OpenClaw 仓库的 issue 和 PR 做自动分诊的方法,在 Pi 智能体框架中运行 gemma-4-26b-a4b 与 qwen3.6-35b-a3b,并借助受限 shell(reposhell)和 final_json 工具输出结构化标签。
MosaicLeaks 提出一项深研究任务,用交错公开与私密信息的多跳问题衡量研究智能体外部查询的隐私泄露,并定义意图、答案、全信息三类泄露指标。团队提出的 Privacy-Aware Deep Research(PA-DR)训练法把严格链成功率从 48.7% 提升到 58.7%,同时把答案或全信息泄露从 34.0% 降到 9.9%。
推荐理由:材料把智能体的外部查询日志视为泄露通道,量化三类泄露,并显示提示词难以约束、需靠训练才能把泄露压低三倍多。
Hugging Face 发布开源评测工具 agent-eval,用于衡量开放模型驱动智能体使用某个库完成任务时的过程成本,而不只看最终答案。
推荐理由:这篇评测以 transformers 为样本,把智能体完成任务的过程成本拆成可量化指标,方法可迁移到其他库。
Hugging Face 在 PEFT 库中加入统一基准测试,发现 LoRA 依然是不错的选择,但其他参数高效微调技术在精度或显存上可以超越它。
AllenAI 发布 MolmoMotion,一个语言引导的 3D 运动预测模型:给定视频帧、物体上的 3D 点和动作指令,预测这些点未来几秒在 3D 空间中的轨迹。
推荐理由:原文给出3D点轨迹的预测表示与机器人和视频生成两类下游验证,可据此理解动作预测的落地路径。
AWS 以 Apache 2.0 开源的 Strands Robots 把 LeRobot 的硬件抽象、仿真和策略推理封装成 AgentTools,让单个 Strands 智能体从 Hugging Face Hub 数据集走到真实机器人。
推荐理由:把从 Hub 数据集到物理机器人的流程拆成五步,仿真与真机共用同一数据集格式,可作为具身智能体接入的参考。
GLM-5.2 发布,是面向长周期任务的旗舰模型,首次在 1M token 上下文上提供该能力,并采用 MIT 开源协议。相比 GLM-5.1,它在 Terminal-Bench 2.1 上从 63.5 提升到 81.0,在 SWE-bench Pro 上从 58.4 提升到 62.1。
推荐理由:GLM-5.2 将上下文扩展到 1M token 并以 MIT 协议开源,读者可对照它与 Claude Opus 4.8、GPT-5.5 在长周期基准上的差距。
Hugging Face 发布了由 Microsoft、Google、GoDaddy、Hugging Face 等贡献者参与开发的 Agentic Resource Discovery(ARD)草案规范,以及参考实现 Discover Tool,让智能体在运行时用自然语言搜索发现 MCP 工具、Skills 和 A2A 智能体,而不必预先安装。
推荐理由:原文给出了 ARD 规范的落地形态与可调用的搜索入口,读者能据此理解智能体按需发现能力的路径。
AllenAI 发布 olmo-eval,一个面向模型开发循环的开源评测工作台,在其 OLMES 评测标准基础上扩展。它把任务、套件与 harness 解耦,支持智能体与多轮评测,并可按需选择直接运行或容器沙箱执行,以控制成本。除整体分数外,它还给出标准误和最小可检测效应,并能将两个模型 checkpoint 逐题对齐比较,以区分真实改进与噪声。代码已在 GitHub 开放。
推荐理由:它把评测从一次性跑分挪进持续训练循环,逐题对比 checkpoint 能看出被平均分掩盖的真实变化。
Hugging Face 博客发布 PyTorch 性能剖析系列第二篇,从 nn.Linear 出发逐步拆解 MLP 的 profiler 轨迹。
ServiceNow AI 发布代码切换语音 ASR 基准与数据集,覆盖西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语四组语言对,并通过 AU-Harness 评测框架开放。
Cohere 发布 North Mini Code,这是其模型家族中首款专为开发者设计的 30B 参数 MoE 模型,激活参数 3B,以 Apache 2.0 许可在 Hugging Face 上线。
一个编码智能体通过读取 Hugging Face Spaces 的 agents.md,串联图像生成 Space ideogram-ai/ideogram4 与单图 3D 重建 Space VAST-AI/TripoSplat,自动搭建出展示巴黎地标 3D Gaussian splat 的静态网站。
推荐理由:原文记录了用 agents.md 让编码智能体串联图像与 3D 重建两个 Space 的完整流程,方法可直接复用。
开发者基于 google/gemma-3-12b-it 用 16-bit LoRA 微调出 NeuroBait,不做待办清单,而是用 3 到 6 句温暖的话帮 ADHD 用户找到当下可做的一小步。
Hugging Face 发布教程,介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行。作者为 Trackio 搭建的方案只需把 runs-on 改成 hf-jobs-* 标签,CPU CI 耗时从 GitHub 托管的 1m40s 降到 1m10s,GPU 测试在 t4-small 上 45 秒跑完、成本不到 1 美分。
推荐理由:文中给出从 GitHub Actions 迁移到 HF Jobs 的完整步骤和实测耗时对比,可供需要 GPU CI 的 ML 项目参考。
在 Build Small Hackathon 的重建实验中,用 OpenAI、NVIDIA、OpenBMB 及一个自微调的 5 亿参数模型分别驱动五个角色后,原本单一模型下蜂蜜价格从 10 跌到 3 的崩盘消失了——五模型议会面对同样的挤兑传言选择囤货,价格反而上涨,三次做空分别亏损 15、26、27 颗石子。
开发者基于 Qwen3.5 4B Q8 通过 llama.cpp 构建了 Pakistan Notice Helper,一款面向巴基斯坦本地的可疑信息分诊工具,支持文本和截图输入,返回风险标签、解释、红旗信号与安全建议。
OpenEnv 宣布由 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk 组成的委员会共同协调,项目地址迁移至 huggingface/OpenEnv。
推荐理由:OpenEnv 由多家机构组成的委员会共同协调,并明确为 RL 环境的互操作层,读者可了解开源智能体训练的协作与协议设计。
开发者用 Nemotron 30b 打造受《The Amazing Digital Circus》启发的 AI 冒险生成器,尝试用长提示词、技能卡、扩大上下文窗口及 Codex 蒸馏技能配合 RAG,均未能让模型稳定生成可运行的 Three.js 游戏,常出现空白画面。
Hugging Face 博客介绍 Room360,一个将普通智能手机视频转为可交互三维环境的 AI 空间重建平台。其流程为视频拆帧、基于 SumantBobade/Image_To_3D_Generator 的图像转 3D、空间对齐融合,并在云端完成推理加速。重建结果可导出轻量格式,用于网页、移动端、虚拟看房、房产与数字孪生等场景。
Her 是一个可上传 Claude Code 会话 .jsonl 文件的诊断工具,能还原会话过程、标出部署与配置改动等风险操作,并展示 token 去向及所用工具、子智能体、技能和 MCP server。
Thousand Token Wood v2 将原先的多智能体经济沙盒改造成玩家扮演影子金融家的游戏,并让每个生物改用不同实验室的小模型思考。议会同时运行 gpt-oss-20b(OpenAI)、MiniCPM3-4B(OpenBMB)、Nemotron-Mini-4B(NVIDIA)和作者自微调的一个 Qwen 0.5B,报告指出摩擦几乎全在服务层而非建模层。
Job Searcher 是 Hugging Face 黑客松发布的开源求职筛选智能体,用 DeepSeek V4 Pro 作教师模型蒸馏出 Qwen3-8B 学生模型,对 LinkedIn 职位按五个维度打分并给出简短理由。
Hugging Face 上的 Persona Atlas 可将任意公众人物转化为可测量的行为画像:小型模型智能体先在开放网络上调研并生成有来源支撑的档案,再以该人物口吻回答十道开放式"思维"问题,答案经嵌入向量化后成为可比较的空间坐标。
开发者用 Qwen2.5-3B 搭建了多智能体经济模拟 Thousand Token Wood,五只林地生物各自作为智能体交易五种商品。该 3B 模型在 75 次调用中 100% 输出合法 JSON,但经济判断力差,需靠更精细的提示词修正。一次 15 回合运行中,蜂蜜价格在银行挤兑传说中从 10 跌至 3,柴火价格随冬季稀缺从 4 涨至 7,财富基尼系数从 0.14 扩大到 0.38。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Google Gemma 3 4B IT 微调,把多模态输入、自定义企业策略与可审计推理链统一到单次推理调用中,并保持 12 种语言显式训练和约 140 种语言的零样本泛化。
推荐理由:相比 Nemotron 3,3.5 版把多模态审核、自定义策略与可审计推理链合并到一次调用中。
NVIDIA 在 Hugging Face 博客给出 Nemotron 3.5 ASR 的微调流程,用约 2000 小时希腊语和保加利亚语数据微调后,在 80ms 流式设置下 WER 分别从 35 降到 24、从 22 降到 15。
推荐理由:文章概述了从基础检查点微调流式多语种 ASR 的流程,并用希腊语和保加利亚语的 WER 变化说明微调对低资源语言的效果。
EVA-Bench Data 2.0 将评测范围从单一企业领域扩展至航空客服、企业 ITSM 和医疗 HR 服务交付三大领域,覆盖 213 个评测场景和 121 个工具,场景覆盖量约为初版的 4 倍。
Hugging Face 博客介绍了为 Nemotron 系列预训练开发的任务种子合成 Q&A 生成流程,用 lm-eval-harness 中约 70 个公开任务、约 700 个子任务的训练集作为能力种子,生成并过滤出带推理与知识上下文的合成数据。
Hugging Face 将官方命令行入口 hf CLI 重构为同时服务人类与编码智能体的工具,agent 模式下自动输出 TSV、不截断数据,并附带可直接执行的下一步命令提示。
推荐理由:官方给出 hf CLI 智能体模式的设计与基准数据,读者可据此了解编码 agent 调用 Hub 时的 token 开销差异。