超越聊天机器人:用模型自身失败样本做 DPO,文本退化率最高降 87.6%
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,把正确转录设为 chosen、重复退化循环设为 rejected,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
huggingface.co · 网站与博客
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,把正确转录设为 chosen、重复退化循环设为 rejected,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅达 87.6%(Nanonets-OCR2–3B 从 1.61% 降至 0.20%)。
Reachy Mini 对话应用现可通过 MCP 调用托管在公开 Hugging Face Spaces 上的工具,用一条命令 `reachy-mini-conversation-app tool-spaces add` 即可为机器人添加天气查询、网页搜索等能力,工具在 Space 内运行、无需下载代码到本地。
H 公司发布 Holo3.1 计算机使用智能体模型家族,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次推出 FP8、Q4 GGUF 和 NVFP4 量化权重。
推荐理由:Holo3.1 在移动端与跨框架适配上补齐短板,量化权重把计算机使用智能体带到本地设备。
JetBrains 发布 12B 参数的 MoE 模型 Mellum2,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。模型在自然语言和代码上从零训练,面向路由、RAG 管线、摘要、子智能体与私有部署等高频低延迟任务,官方称其推理速度比同规模模型快 2 倍以上。模型权重已在 Hugging Face 上线,架构、训练与评测细节见其技术报告。
Hugging Face 博客指出,企业级 AI 规模化落地的关键不在 LLM 本身,而在 agent 逻辑——即知识图谱、算法、程序分析库等运行于 agent 层的软件原语,可主动引导 LLM 聚焦企业工作流、压缩上下文空间。
NVIDIA 在 Hugging Face 上发布 Cosmos 3,这是一个面向物理 AI 的开源全模态模型。它基于 Mixture-of-Transformers 架构,将世界生成、物理推理与动作生成整合到单一模型中。
推荐理由:NVIDIA 将世界生成、物理推理与动作生成整合到一个模型中,并给出开源模型与 Diffusers 接入方式。
Hugging Face 博客发布 PyTorch profiling 系列第一篇,以矩阵乘法加加法为例讲解 torch.profiler 的用法。文章说明 profiler 会导出统计表格和 Perfetto 时序 trace 两类产物,并演示如何用 warmup 消除冷启动开销、区分 CPU 与 GPU lane 以及读懂嵌套的调度链,最后附上速查表。
推荐理由:面向初学者的 torch.profiler 阅读指南,用两个矩阵算子串起从 CPU 调度到 CUDA 内核的完整链路,并附上速查表。
Artificial Analysis 与 IBM 软件创新实验室发布 ITBench-AA,这是首个面向智能体企业 IT 任务的基准系列,首批聚焦 SRE 场景,前沿模型得分均低于 50%。
推荐理由:前沿模型在这套企业IT智能体基准上全部低于50%,并给出开源权重模型的每任务成本对照,可作为能力与成本参照。
Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。
推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。
Hugging Face 发布教程,用自家 speech-to-speech 库把 Reachy Mini 的对话链路全部搬到本地,无需云服务、API key,音频不出本机。
推荐理由:给出了一条可整套照搬的本地语音链路,读者能据此把 VAD、STT、LLM、TTS 各环节换成自己的模型。
NVIDIA 发布 Nemotron-Labs Diffusion 系列扩散语言模型,包含 3B、8B、14B 文本模型和 8B 视觉语言模型,均提供基础版与指令微调版。
推荐理由:原文给出该系列的多规模配置与三种推理模式的实测对比数据,读者可据此判断扩散语言模型在延迟敏感场景中的可行性。
Dharma 的 DharmaOCR 基准显示,一个 3B 参数专用小模型在巴西葡萄牙语 OCR 任务上以 0.911 的综合得分超过 Claude Opus 4.6(0.833)、Gemini 3.1 Pro(0.820)和 GPT-5.4(0.750)等所有被测商业前沿 API,且每百万页推理成本低约 52 倍。该模型还取得最低的文本退化率,模型与基准均已在 Hugging Face 发布。
Hugging Face 发布 OlmoEarth v1.1 地球观测模型系列,在保持 v1 性能的同时将计算成本最高降低 3 倍。该系列通过将 Sentinel-2 各分辨率合并为单一 token 缩短序列长度,并修改预训练方案以避免性能下降,提供 Base、Tiny、Nano 三种规模,权重与训练代码已开放。
Hugging Face 发布 Ettin Reranker 系列六款 CrossEncoder 重排序模型,参数从 17M 到 1B,均基于 Ettin ModernBERT 编码器,采用从 mxbai-rerank-large-v2 做逐点 MSE 蒸馏的配方训练。
NVIDIA 在 Hugging Face 博客发布指南,介绍用 LoRA 和 DoRA 对 2B 的 Cosmos Predict 2.5 做参数高效微调,用于生成机器人操作视频。
PaddleOCR 3.5 发布,支持通过 engine="transformers" 将 Hugging Face Transformers 作为受支持模型的推理后端,OCR 与文档解析流程仍由 PaddleOCR 管理。
IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。
推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。
IBM 发布两个 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2,基于 ModernBERT,覆盖 200+ 语言、32K token 上下文,并支持 9 种编程语言的代码检索。
推荐理由:两个模型以 Apache 2.0 覆盖 200+ 语言和 32K 上下文,读者可对照基准表判断小模型在多语言检索上的实际取舍。
Hugging Face 发布技术文章,讲解如何用异步批处理把 CPU 批准备与 GPU 计算解耦,让两者并行执行。在 8K tokens、batch size 32、8B 模型的测试中,生成时间从 300.6 秒降到 234.5 秒,提速 22%,GPU 活跃时间占比从 76.0% 升到 99.4%。
AWS 发布系列文章,解析其基础设施如何与开源软件栈配合支撑基础模型全生命周期。文章梳理了从 Amazon EC2 P5(H100/H200)到 P6(Blackwell B200/B300)的加速实例、高带宽低延迟网络与分布式存储,并覆盖 Slurm、Kubernetes、PyTorch、JAX 及 Prometheus、Grafana 等编排与可观测性层。
AI2 发布 EMO,一个 1B 激活、14B 总参数(8 专家激活、128 专家总量)的混合专家模型,在 1 万亿 token 上端到端预训练,让模块化结构直接从数据中涌现。保留 25% 专家时各基准平均性能只下降约 1%,仅保留 12.5% 专家时平均下降约 3%,而同等架构的标准 MoE 在相同子集设置下明显退化。团队同时开源了 EMO 模型、同等数据的标准 MoE 基线和训练代码。
推荐理由:EMO 让专家子集按语义领域自然分组,只保留 12.5% 专家仍接近全模型性能,为稀疏 MoE 的部署取舍提供参考。
ServiceNow AI 的 PipelineRL 从 vLLM V0 迁移到 V1 时,修复了 logprobs 语义、V1 运行时默认值、inflight 权重更新路径和 fp32 lm_head 四项,使 clip rate、KL、熵和 reward 等训练指标重新贴近 V0 参考。
Hugging Face 联合 Appen Inc. 和 DataoceanAI 为 Open ASR Leaderboard 引入高质量私有英文 ASR 数据集,覆盖多口音的朗读与对话语音,以防止 benchmaxxing 和测试集污染。榜单默认平均 WER 仍仅基于公开数据集计算,用户可通过开关选择是否纳入私有数据集查看影响。该榜单自 2023 年 9 月上线以来访问量已超 710K 次。
IBM Granite 团队发布技术解读,说明 Granite 4.1 系列 3B、8B、30B 稠密模型基于约 15T token 的五阶段预训练流程构建,上下文窗口经长上下文扩展至 512K。
推荐理由:原文完整披露 Granite 4.1 的五阶段预训练数据配比与多阶段 RL 流程,可供同类小模型训练参考。
DeepInfra 正式接入 Hugging Face Hub 成为官方 Inference Provider,首批支持对话与文本生成任务,可调用 DeepSeek V4、Kimi-K2.6、GLM-5.1 等开源权重模型。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
作者基于 OpenAI 本周在 Hub 上开源的 Privacy Filter,用 gradio.Server 搭建了三个 PII 脱敏 Web 应用:文档高亮浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章以三个可运行示例展示 Privacy Filter 的接入方式,可供搭建 PII 脱敏应用时参考。
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
Hugging Face 发布指南,讲解如何在 Chrome 扩展(Manifest V3)中用 Transformers.js 运行本地模型,并复现其 Gemma 4 浏览器助手的核心架构。
推荐理由:用一个已上线的浏览器扩展拆解 MV3 下的分层架构,可供搭建本地模型扩展时参考分工与数据边界。
QIMMA 是一个质量优先的阿拉伯语 LLM 排行榜,在评测模型前先对基准样本做多阶段质量校验,整合 14 个来源基准的 109 个子集、超过 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌文学与编码 7 个领域,其中 99% 为原生阿拉伯语内容。
Hugging Face 发文讨论 AI 网络安全的走向,主张开放生态能让防御方获得攻击方同类的漏洞发现与修补能力。文章以 Mythos 和 Project Glasswing 为例,指出真正起作用的是模型所处的系统而非模型本身,并建议用半自主智能体配合开源安全工具,在机构内部署可审计的防御方案。