Mistral AI 发布 Robostral Navigate:8B 具身导航模型,单 RGB 相机在 R2R-CE 达 76.6%
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个普通 RGB 相机和自然语言指令即可让机器人在复杂环境中自主导航,在 R2R-CE validation unseen 达到 76.6% 成功率,领先最佳单相机方案 9.7 分、领先使用深度或多相机方案 4.5 分。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个普通 RGB 相机和自然语言指令即可让机器人在复杂环境中自主导航,在 R2R-CE validation unseen 达到 76.6% 成功率,领先最佳单相机方案 9.7 分、领先使用深度或多相机方案 4.5 分。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。
推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。该研究采用全城 switchback 实验设计,每座城市选取约 100 个拥堵路段,每年每城可减少数千吨 CO2e 排放。
Anthropic 在 Claude Console 中支持创建 API key 或 Admin API key 时设置有效期,可选预设时长、自定义时长或永不过期。有效期不少于 7 天的 key,Anthropic 会在到期前邮件通知创建者,已有 key 不受影响。Admin API 通过 expires_at 字段返回每个 key 的到期时间。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较基于 Host DRAM 的方案降低 6.7 倍。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。
推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。
UC Berkeley 的 Aditya G. Parameswaran 等人发表观点文章,认为近零推理成本时代将重塑数据系统研究。
OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。
推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
Hugging Face 官方博客总结 🤗 Kernels 项目数月来的重大更新,包括 Hub 新增 kernel 仓库类型、默认仅加载受信任发布者的 kernel、基于 Sigstore cosign 的代码签名、重构 kernels 与 kernel-builder 的 CLI。
SGLang 现已支持 DSpark 投机解码,在 dense 和 sparse 模型(如 Qwen3、DeepSeek-V4)上均可用。DSpark 采用半自回归块草稿器与基于草稿模型置信度的逐请求变长验证,减少无效 token 验证。在 H200 上以 DeepSeek-V4-Flash 测试,其吞吐/延迟权衡在整个并发扫描中优于 MTP 和非投机基线。
Google DeepMind 与 A24 宣布一项研究导向的合作,双方将跨多个项目共同开发新的工作流与技术,让电影创作者参与塑造未来工具。Google 同时对 A24 进行了投资,具体目标与技术产出将随合作推进逐步演化。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。
推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。
Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。
Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者(过半来自年营收超 $10B 的企业)无论技术背景如何,都做出了可运行的 AI 智能体。有人三小时完成原本需六个月的工作,还有人把 Ghostwriter 指向知识库后 15 分钟一次性生成智能体。现场产出涵盖理赔受理、贷款资格审核、药房福利语音智能体等,其中一个账户解锁智能体在活动结束前已部署到生产环境。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
Anthropic 新增 agent-memory-2026-07-22 beta header,改变记忆列表接口行为:结果按服务端固定顺序返回,order_by 和 order 参数被忽略,depth 仅接受 0、1 或省略,path_prefix 必须以 / 结尾并按整段路径匹配。
Runway 宣布与媒体、服务与教育公司 Bertelsmann 达成创意合作,其 AI 模型将整合进 Bertelsmann 全球业务组合,包括 RTL Group、BMG 和 Bertelsmann Marketing Services。双方自 2024 年通过 Bertelsmann AI Hub 开始合作,此次扩展将共同开发和落地 AI 创意工作流。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 等方向。
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
IBM Research 发布开放基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的企业 Java 框架迁移任务,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项实验默认按解决率和流失率降低等结果指标评估。Ghostwriter 会分析全部客户对话,将发现的模式转化为假设并在数分钟内发布为实验。团队可逐步放量,确认统计显著后将胜出版本推至 100% 流量。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,验证 RMSE 仅 0.04,建模显示定向 cool-roof 规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),文生图延迟 4 秒。
推荐理由:官方公告给出了两款模型的定位、价格、延迟和已知限制,开发者可直接据此选型和接入。
Anthropic 已恢复 Claude Fable 5 和 Claude Mythos 5 的访问权限。官方表示相关说明可参见其声明,但未披露此次中断的具体原因与时长。
OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。
推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,将积压多年的歌词转化为歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。他发布的一条视频收获数百条求歌名评论,让他重新审视自己的音乐创作流程。他表示目标不是让人关注工具,而是让人产生情感共鸣。
Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。
推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。
Runway 宣布与日本科技公司 MIXI 达成企业级战略合作,MIXI 已在游戏、体育、生活方式和数字娱乐业务中部署 Runway。Monster Strike 繁中版视频制作从 21 天缩短到 3 天,品牌片从 20 天缩短到 7 天,角色动画视觉提案可缩短至 5 分钟。
Anthropic 已移除 Claude Opus 4.6 的快速模式,请求 claude-opus-4-6 时带 speed: "fast" 不再以快速速度和溢价计费,而是按标准速度运行、按标准费率计费且不报错,响应中的 usage.speed 字段会报告实际使用的速度。要继续使用快速模式,需迁移至 Claude Opus 4.8。
OpenRouter 认为 2026 年 6 月最值得关注的四款开放权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开放权重模型与美国前沿实验室的能力差距已连续 18 个月保持在 3-6 个月且未在扩大。
推荐理由:OpenRouter 用自家价格与吞吐数据逐一点评四款开放权重模型的适用场景,读者可以按成本、质量和模态对号入座选型。
Google Research 推出新架构,将多 Token 预测(MTP)头挂载到已冻结的 Gemini Nano v3 上,在 Pixel 9 上实现 50% 以上的推理加速。
拥有超 3000 万粉丝、50 亿次播放的洛杉矶舞者兼 DJ Matt Steffanina 表示,自己曾围绕他人音乐积累数十亿播放量,却不拥有任何底层资产,直到开始创作并拥有与内容相关的音乐才拿回长期控制权。他透露用 Suno 把音乐创意从数天缩短到几分钟落地,并称 Suno 与 Hooks 更聚焦创作者,让创作过程重新变得像玩一样。
纽约钢琴家兼作曲家 Eric Christian 在 Suno 博客专访中表示,Suno 是他创作新旋律时的最后一道检验,能在几秒内听到作品真正想要的交响效果,而过去做管弦乐 mockup 要花数小时。他已在 200 个国家售出超 10 万份乐谱,并称自己是最早在 Hooks 上认真创作的古典作曲家之一。面对质疑 AI 工具的古典音乐人,他的态度是“要么适应,要么被淘汰”。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
Anthropic 上调 Claude API 速率限制,Claude Sonnet 和 Claude Haiku 的限额在所有用量层级上与 Claude Opus 持平,用量层级合并为 Start、Build、Scale 三档。多数组织将升至更高层级,没有组织的限额低于此前,且无需任何操作,可在 Claude Console 查看当前层级与限额。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小。在 Spanner 生产环境测试数月后,内存用量降低 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。
Runway 发布 Agent 2.0,一款面向营销人员的升级版智能体,已向所有用户开放。用户可在对话中导入广告投放、产品发布或目标受众等信息,Agent 会分析并提问,协助生成和优化营销内容。它支持从 Meta、YouTube、TikTok、Google 导入广告指标,并自动输出 9:16、16:9、1:1 等平台适配格式。