Strands Robots 教程:用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制、训练与部署的数据闭环
Strands Robots 推出流式数据循环教程,在单个 agent 内录制演示到 Storage Bucket、增量同步、直接从 Hub 流式训练并将 checkpoint 部署回实体 SO-101,全程保持 LeRobot 格式。
huggingface.co · 网站与博客
Strands Robots 推出流式数据循环教程,在单个 agent 内录制演示到 Storage Bucket、增量同步、直接从 Hub 流式训练并将 checkpoint 部署回实体 SO-101,全程保持 LeRobot 格式。
Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 Open Reproductions 挑战赛,1,221 名参与者用 Claude Code、Codex、Cursor 等智能体在 19 天内发布 6,816 份 Trackio 日志,复现 2,226 篇论文,约占会议的 34%。
推荐理由:官方复盘给出了逐条声明级别的复现数据和失败案例,可迁移到用智能体做大规模论文审计的工作流。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出嵌入向量,用户可通过 UI 或 API 选择区域、时间范围、编码器变体(Nano 128 维 1.4M 参数、Tiny 192 维 6.2M 参数、Base 768 维 89M 参数)、分辨率和影像源,输出 Cloud-Optimized GeoTIFF。
Liquid AI 发布 LFM2.5-VL-3B,一款约 3.1B 参数、可在本地硬件运行的视觉语言模型,已在 Hugging Face 开放下载。相比上一代,它在屏幕与 UI 理解、自然语言目标定位、多图输入和函数调用四方面做了改进。
IBM Research 在 AppWorld 上自跑对比 ALTK-Evolve 与 ACE,两者都把智能体历史轨迹转成可复用经验且都不压缩经验,核心差异在交付:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guideline。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开放权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
Hugging Face 最新论文提出两项系统改动降低 LLM 知识蒸馏成本:一是离线缓存教师模型每位置的 top-100 logits,训练时无需再加载教师;二是融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB 显存,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Hugging Face 发布 TutorMoments 预览版,用真实一对一数学辅导记录回放式评测 LLM 导师的介入时机判断。数据集含 462 份脱敏文字记录、1500 多个教师标注关键时刻,来自 27 位美国教师标注者。测试 7 个 LLM 发现,仅被告知"好好辅导"时模型倾向过度帮助,在提示词中写明"帮与不帮"的权衡可提升表现,但仍未追平人类导师。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务,可访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM。
Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。
Hugging Face 博客指出,AI 行业的下一个真正约束不是智能而是利用率:GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因硬件实际使用率而拉开差距。
Ai2 推出 OlmoEarth Platform,用于把地理空间基础模型从微调、评估一路支撑到大规模推理。该平台可在约一天内完成洲级区域推理,处理数十 TB 影像,成本为每平方公里不到一美分。北美野火风险图任务峰值动用约 19,600 个 CPU 和 994 个 GPU,网络吞吐超 168 GB/s,把预计 4,737 小时的串行计算压缩到约 30.5 小时,实现 155× 加速。
Liquid AI 在 Hugging Face 发布两个编码器模型 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,支持 8,192 token 上下文,在 CPU 上长上下文推理比 ModernBERT-base 快约 3.7 倍。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 加速推理库部署。
Hugging Face 发布针对其平台智能体入侵事件的技术复盘,还原 2026-07-09 至 07-13 约 4.5 天、约 17,600 个攻击动作的完整链条。
推荐理由:当事方逐日还原攻击链与修复措施,读者可以据此理解智能体级入侵的实际形态与防御要点。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,通过 from_pretrained() 直接加载 Nunchaku(SVDQuant)W4A4 量化检查点,无需单独推理引擎或本地 CUDA 编译。
推荐理由:官方介绍 Diffusers 原生加载 Nunchaku Lite 4-bit 检查点,附基准数据与自行量化发布流程,可迁移到消费级 GPU 部署。
Hugging Face 发布物理 AI 仿真综述,指出机器人训练缺乏互联网级数据,仿真可低成本生成数千小时机器人经验。文章梳理了 MuJoCo、MuJoCo Warp(MJWarp)、NVIDIA Isaac Sim 与 Isaac Lab 等主流引擎,并提出训练、仿真、机载三计算机范式,其中机载端以 NVIDIA Jetson AGX Thor 级设备运行策略。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪录制人类操作演示并自动转成 LeRobot 机器人数据集,无需机器人和遥操作设备。
NVIDIA 在 Hugging Face 的 Cosmos 3 仓库发布 Cosmos 3 Edge,一个 40 亿参数的开源世界模型,帮助机器人和视觉 AI 智能体理解环境、实时推理并生成机器人动作。
推荐理由:40 亿参数模型在边缘设备上实现实时推理与机器人控制,为端侧物理 AI 提供了可直接部署的开源世界模型。
NVIDIA 和 Hugging Face 推出 NeMo Automodel 与 Diffusers 的集成,为 Hub 上任意 Diffusers 格式模型提供生产级分布式扩散训练,无需转换 checkpoint 或重写模型。
推荐理由:NVIDIA 与 Hugging Face 把分布式扩散训练接入 Diffusers,无需转换 checkpoint 或重写模型,可直接微调现有开源扩散模型。
NVIDIA 发布 Nemotron 3 Embed 系列开源商用嵌入模型,包含 8B 旗舰版与两个 1B 版本,其中 Nemotron-3-Embed-8B-BF16 在 RTEB 排行榜排名第一。
DharmaOCR 在葡萄牙语 OCR 基准上取得 0.925 分,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型通过葡萄牙语监督微调加 DPO 两阶段训练,将全部参数集中于巴西葡萄牙语,从而在提取质量与稳定性上保持优势。
Hugging Face 披露其生产基础设施遭入侵,攻击由一个自主 AI 智能体系统端到端驱动,攻击者利用数据集处理的两个代码执行路径获得初始访问,窃取部分内部数据集和服务凭证。
推荐理由:官方披露由自主 AI 智能体发起的基础设施入侵与处置细节,读者可以看到防御方如何用自有模型完成取证并应对护栏限制。
Ai2 的 Skylight 团队分享了海事 AI 智能体 Shippy 的架构:由系统提示词构成的 soul、按 agent-skills 规范编写的 skills,以及涵盖 OpenClaw 框架和 Claude Opus 4.6 模型的 config 三部分组成。
IBM Research 团队撰文指出,把 Agent 系统中的模型路由当作分类问题会失效,实际是成本、质量、延迟与合规并存的系统优化问题。
Hugging Face 团队推出 Real World VoiceEQ 基准,评估语音交互的人类化质量,覆盖 40 多个专有和开源语音模型、15+ 维度和 60 多项指标,涉及 ASR、TTS、S2S 和语音理解。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比手写 attention 与 SDPA 的 math、efficient、flash、cuDNN 后端。
NVIDIA Nemotron 开放数据产品已发布超 10 万亿预训练 token 和数百万后训练样本,并推出 Nemotron Post-Training v3 Prompt Atlas 交互式可视化地图,可按数据集、流程阶段、领域或工具使用筛选提示词样本。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。
推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,用户在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,即可直达 SageMaker Studio 并预加载所选模型。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。
推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
Hugging Face 官方博客总结 🤗 Kernels 项目数月来的重大更新,包括 Hub 新增 kernel 仓库类型、默认仅加载受信任发布者的 kernel、基于 Sigstore cosign 的代码签名、重构 kernels 与 kernel-builder 的 CLI。
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
IBM Research 发布开放基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的企业 Java 框架迁移任务,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
针对 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,Dharma AI 撰文解读其核心论点:专业化是有效 AI 系统的决定性原理之一。