跳到正文

全部动态

今日 26 条
7月8日周三
  1. Hugging Face Blog64

    Hugging Face:vLLM 的 transformers 后端达到原生实现速度

    Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。

    推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。

  2. Google Research47

    Google Research 用 Google Maps 路由干预缓解城市拥堵

    Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至替代路线,在美国 10 座城市测试后,目标路段行驶速度中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%。该研究采用全城 switchback 实验设计,每座城市选取约 100 个拥堵路段,每年每城可减少数千吨 CO2e 排放。

  3. Claude Platform release notes36

    Claude Console 支持为 API key 设置有效期

    Anthropic 在 Claude Console 中支持创建 API key 或 Admin API key 时设置有效期,可选预设时长、自定义时长或永不过期。有效期不少于 7 天的 key,Anthropic 会在到期前邮件通知创建者,已有 key 不受影响。Admin API 通过 expires_at 字段返回每个 key 的到期时间。

7月7日周二
  1. Hugging Face Blog61

    Microsoft Foundry Managed Compute 上线 Hugging Face 精选模型集

    Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。

    推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。

  2. OpenRouter Announcements71

    OpenRouter 实测图像 detail 参数:推理模型用 low 更贵更差

    OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。

    推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。

  3. Hugging Face Blog61

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准

    Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。

    推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。

  4. Hugging Face Blog63

    Hugging Face 与 SkyPilot 推出 store: hf,跨云读取 Hub 数据免出流费

    Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。

    推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。

7月6日周一
  1. Hugging Face Blog43

    PRX Part 4:我们的数据策略

    PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。

7月3日周五
7月2日周四
  1. Mistral AI64

    Mistral 发布 Leanstral 1.5:6B 激活参数的开源形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。

    推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。

  2. Runway News38

    Runway 如何回收夜间闲置推理 GPU 用于研究

    Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。

  3. Sierra Blog33

    Sierra Ghostwriter 黑客松:30 人用 AI 智能体三小时完成原本六个月的工作

    Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者(过半来自年营收超 $10B 的企业)无论技术背景如何,都做出了可运行的 AI 智能体。有人三小时完成原本需六个月的工作,还有人把 Ghostwriter 指向知识库后 15 分钟一次性生成智能体。现场产出涵盖理赔受理、贷款资格审核、药房福利语音智能体等,其中一个账户解锁智能体在活动结束前已部署到生产环境。

7月1日周三
  1. Sierra Blog46

    Sierra 在 Agent Studio 推出 Experiments,让客户行为驱动 AI 智能体优化

    Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项实验默认按解决率和流失率降低等结果指标评估。Ghostwriter 会分析全部客户对话,将发现的模式转化为假设并在数分钟内发布为实验。团队可逐步放量,确认统计显著后将胜出版本推至 100% 流量。

6月30日周二
  1. OpenRouter Announcements74

    OpenRouter 数据分析:DeepSeek V4 上线后 token 份额从 9% 翻倍至 18%

    OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。

    推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。

  2. Suno Blog37

    Dream Relic 如何用 Suno 让声音在脑海中挥之不去

    AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,将积压多年的歌词转化为歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。他发布的一条视频收获数百条求歌名评论,让他重新审视自己的音乐创作流程。他表示目标不是让人关注工具,而是让人产生情感共鸣。

  3. Claude Platform release notes79

    Anthropic 发布 Claude Sonnet 5,1M 上下文、$2/$10 每 MTok 定价并说明迁移变化

    Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。

    推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。

6月29日周一
  1. Runway News52

    Runway 与 MIXI 达成企业级战略合作

    Runway 宣布与日本科技公司 MIXI 达成企业级战略合作,MIXI 已在游戏、体育、生活方式和数字娱乐业务中部署 Runway。Monster Strike 繁中版视频制作从 21 天缩短到 3 天,品牌片从 20 天缩短到 7 天,角色动画视觉提案可缩短至 5 分钟。

  2. Claude Platform release notes30

    Anthropic 移除 Claude Opus 4.6 快速模式

    Anthropic 已移除 Claude Opus 4.6 的快速模式,请求 claude-opus-4-6 时带 speed: "fast" 不再以快速速度和溢价计费,而是按标准速度运行、按标准费率计费且不报错,响应中的 usage.speed 字段会报告实际使用的速度。要继续使用快速模式,需迁移至 Claude Opus 4.8。

6月27日周六
  1. OpenRouter Announcements76

    OpenRouter 评出 2026 年 6 月最值得关注的四款开放权重模型

    OpenRouter 认为 2026 年 6 月最值得关注的四款开放权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开放权重模型与美国前沿实验室的能力差距已连续 18 个月保持在 3-6 个月且未在扩大。

    推荐理由:OpenRouter 用自家价格与吞吐数据逐一点评四款开放权重模型的适用场景,读者可以按成本、质量和模态对号入座选型。

6月26日周五
  1. Suno Blog25

    Matt Steffanina 谈为何舞者要拥有自己作品背后的音乐

    拥有超 3000 万粉丝、50 亿次播放的洛杉矶舞者兼 DJ Matt Steffanina 表示,自己曾围绕他人音乐积累数十亿播放量,却不拥有任何底层资产,直到开始创作并拥有与内容相关的音乐才拿回长期控制权。他透露用 Suno 把音乐创意从数天缩短到几分钟落地,并称 Suno 与 Hooks 更聚焦创作者,让创作过程重新变得像玩一样。

  2. Suno Blog32

    Suno 专访钢琴家 Eric Christian:用 AI 听见旋律里的交响乐团

    纽约钢琴家兼作曲家 Eric Christian 在 Suno 博客专访中表示,Suno 是他创作新旋律时的最后一道检验,能在几秒内听到作品真正想要的交响效果,而过去做管弦乐 mockup 要花数小时。他已在 200 个国家售出超 10 万份乐谱,并称自己是最早在 Hooks 上认真创作的古典作曲家之一。面对质疑 AI 工具的古典音乐人,他的态度是“要么适应,要么被淘汰”。

6月25日周四
  1. Runway News41

    Runway 推出 Agent 2.0,面向营销场景的升级版智能体

    Runway 发布 Agent 2.0,一款面向营销人员的升级版智能体,已向所有用户开放。用户可在对话中导入广告投放、产品发布或目标受众等信息,Agent 会分析并提问,协助生成和优化营销内容。它支持从 Meta、YouTube、TikTok、Google 导入广告指标,并自动输出 9:16、16:9、1:1 等平台适配格式。