Claude Dreams 研究预览版支持 Claude Fable 5 和 Claude Sonnet 5
Claude Dreams 研究预览版现已支持 Claude Fable 5 和 Claude Sonnet 5。
Claude Dreams 研究预览版现已支持 Claude Fable 5 和 Claude Sonnet 5。
Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并支持通过 MCP 服务器直接调用 Skills。该功能面向 Mistral Studio 客户开放,数据始终保留在企业边界内。
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
微软 AI 与诗歌推广人 William Sieghart、创意工作室 Gravity Road 合作推出数字诗歌体验 Ode Poetry,基于 MAI 音频模型实现实时对话与诗歌推荐。
空山慈科技联合创始人王曦明在播客中介绍了用脑机交互与神经调控治疗抑郁症、睡眠障碍和认知问题的思路,探讨物理能量调控大脑的路径,以及脑机接口如何从三甲医院临床延伸至居家卧室场景。
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个普通 RGB 相机和自然语言指令即可让机器人在复杂环境中自主导航,在 R2R-CE validation unseen 达到 76.6% 成功率,领先最佳单相机方案 9.7 分、领先使用深度或多相机方案 4.5 分。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。该研究采用全城 switchback 实验设计,每座城市选取约 100 个拥堵路段,每年每城可减少数千吨 CO2e 排放。
Anthropic 在 Claude Console 中支持创建 API key 或 Admin API key 时设置有效期,可选预设时长、自定义时长或永不过期。有效期不少于 7 天的 key,Anthropic 会在到期前邮件通知创建者,已有 key 不受影响。Admin API 通过 expires_at 字段返回每个 key 的到期时间。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较基于 Host DRAM 的方案降低 6.7 倍。
UC Berkeley 的 Aditya G. Parameswaran 等人发表观点文章,认为近零推理成本时代将重塑数据系统研究。
OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。
推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
Jack Clark 在 Import AI 464 期中汇总多项进展:Fable 在 KernelBench-Mega 上提交了首个也是最快的 megakernel。
Hugging Face 官方博客总结 🤗 Kernels 项目数月来的重大更新,包括 Hub 新增 kernel 仓库类型、默认仅加载受信任发布者的 kernel、基于 Sigstore cosign 的代码签名、重构 kernels 与 kernel-builder 的 CLI。
SGLang 现已支持 DSpark 投机解码,在 dense 和 sparse 模型(如 Qwen3、DeepSeek-V4)上均可用。DSpark 采用半自回归块草稿器与基于草稿模型置信度的逐请求变长验证,减少无效 token 验证。在 H200 上以 DeepSeek-V4-Flash 测试,其吞吐/延迟权衡在整个并发扫描中优于 MTP 和非投机基线。
Google DeepMind 与 A24 宣布一项研究导向的合作,双方将跨多个项目共同开发新的工作流与技术,让电影创作者参与塑造未来工具。Google 同时对 A24 进行了投资,具体目标与技术产出将随合作推进逐步演化。
Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。
推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。
Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。
Dwarkesh Patel 的 AI 大问题征文赛收到超过 600 篇 essays,并公布三名获奖者及全文。
Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者(过半来自年营收超 $10B 的企业)无论技术背景如何,都做出了可运行的 AI 智能体。有人三小时完成原本需六个月的工作,还有人把 Ghostwriter 指向知识库后 15 分钟一次性生成智能体。现场产出涵盖理赔受理、贷款资格审核、药房福利语音智能体等,其中一个账户解锁智能体在活动结束前已部署到生产环境。
十字路口与真格基金「此话当真」串台播客复盘 Agent 元年 500 天,嘉宾为真格投资总监钟天杰和 AI 开发者归藏。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
真格基金「此话当真」与「十字路口」串台播客在 Agent 元年第 500 天复盘:Claude 3.5 Sonnet 在第 100 天前后为 Agent 提供能力基础并带火 Manus,第 300 天 Claude Code 刷屏。节目以 GUI 退场、Headless 上位、CLI 复兴、Skills 封装、Agentic Economy 萌芽为主线,讨论为何不该再投资 GUI 思维的软件。
Anthropic 新增 agent-memory-2026-07-22 beta header,改变记忆列表接口行为:结果按服务端固定顺序返回,order_by 和 order 参数被忽略,depth 仅接受 0、1 或省略,path_prefix 必须以 / 结尾并按整段路径匹配。
Runway 宣布与媒体、服务与教育公司 Bertelsmann 达成创意合作,其 AI 模型将整合进 Bertelsmann 全球业务组合,包括 RTL Group、BMG 和 Bertelsmann Marketing Services。双方自 2024 年通过 Bertelsmann AI Hub 开始合作,此次扩展将共同开发和落地 AI 创意工作流。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 等方向。
Hugging Face 与 Cerebras 展示了一套全开源、模块化可替换的实时语音到语音流水线,语言模型采用 Google DeepMind 的 Gemma 4 31B,在 Cerebras 上推理,语音识别用 Nvidia Parakeet,语音合成用 Alibaba Qwen3TTS。
IBM Research 发布开放基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的企业 Java 框架迁移任务,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项实验默认按解决率和流失率降低等结果指标评估。Ghostwriter 会分析全部客户对话,将发现的模式转化为假设并在数分钟内发布为实验。团队可逐步放量,确认统计显著后将胜出版本推至 100% 流量。
Google Research 将建筑级屋顶反射率数据集扩展至 9 个国家 50+ 城市,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,验证 RMSE 仅 0.04,建模显示定向 cool-roof 规划可使全球城市极端高温降低最多 0.5°C。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),文生图延迟 4 秒。
推荐理由:官方公告给出了两款模型的定位、价格、延迟和已知限制,开发者可直接据此选型和接入。
Anthropic 已恢复 Claude Fable 5 和 Claude Mythos 5 的访问权限。官方表示相关说明可参见其声明,但未披露此次中断的具体原因与时长。
3Blue1Brown 的 Grant Sanderson 在播客中讨论 AI 在数学领域的进展。他指出 AI 自 2024 年起能在 19 秒内解出 IMO 几何题,但在组合数学题上仍表现吃力,数学内部的进展呈现"分形"式的不均衡。他还探讨了 AI 能否找到领域间隐藏联系、概念性突破的验证周期可能长达一个世纪,以及 AI 是否净增人类对数学的理解。
OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。
推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,将积压多年的歌词转化为歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。他发布的一条视频收获数百条求歌名评论,让他重新审视自己的音乐创作流程。他表示目标不是让人关注工具,而是让人产生情感共鸣。
Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。
推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。
NVIDIA 推出 ENPIRE 框架,让编码智能体自主为真实机器人开发策略,在 PushT、整理插针、用切割器剪断扎带等任务上达到 99% 成功率,测试中还尝试了往主板插 GPU。
Runway 宣布与日本科技公司 MIXI 达成企业级战略合作,MIXI 已在游戏、体育、生活方式和数字娱乐业务中部署 Runway。Monster Strike 繁中版视频制作从 21 天缩短到 3 天,品牌片从 20 天缩短到 7 天,角色动画视觉提案可缩短至 5 分钟。
最新一期开源成果盘点收录了 NVIDIA Nemotron-3-Ultra-550B-A55B、Cohere Command A+、GLM-5.2、Zyphra ZAYA1-74B-preview 和 Poolside Laguna-M.1 等模型。