跳到正文

#产品更新

今日 7 条
9月2日周三
  1. Runway News35

    Miro 如何用 Runway 为四地市场制作 Canvas26 主题演讲视频

    Miro 品牌团队完全用 Runway 生成 Canvas26 年度活动开场视频,并针对 4 个城市分别制作本地化版本,所有城市景观、人群和入场镜头均由 Runway 生成,再叠加动效与品牌元素。团队用场馆照片作为 Runway 参考图生成对应地点的电影感入场镜头,并借助 Runway 原生生成非标准宽高比画面,避免 4K 素材裁切损失分辨率。

  2. Google DeepMind68

    Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。

    推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。

9月1日周二
8月29日周六
  1. LMSYS Blog60

    SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

    SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。

    推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。

8月28日周五
8月27日周四
  1. Google DeepMind65

    Google DeepMind 发布语音转写模型 Gemini 3.5 Transcribe

    Google DeepMind 推出语音转文字模型 Gemini 3.5 Transcribe,定位为更精确的实时转写模型,已在 Gemini API(Google AI Studio 和 Gemini Enterprise Agent Platform)开启公开预览。

    推荐理由:官方给出了两个 API 入口、WER 数字和与 Chirp 3 的对比,读者可据此评估其语音转写与语音交互场景的可用性。

  2. Anthropic Newsroom60

    Anthropic 开启 Model Hardware Standard 研究预览,让 AI 智能体安全操控实验与制造设备

    Anthropic 开放 Model Hardware Standard(MHS)研究预览,这是让 AI 智能体安全操作物理设备的标准规范,首批面向科研实验室和先进制造商,可将原本需数周至数月的硬件集成缩短到数小时或数分钟。

    推荐理由:官方介绍 MHS 标准化驱动如何把硬件集成从数周缩到数分钟,并给出多家机构实测用例,对关注智能体操控实体设备的读者有参考。

8月26日周三
  1. Google Developers Blog35

    Google Cloud 在 Cloud TPU 上为 vLLM 带来企业级长上下文多模态嵌入推理

    Google Cloud 将原生 TPU 支持集成进 vLLM,用于在 Cloud TPU 上服务 Qwen3-Embedding 系列嵌入模型,支持 4K+ token 文本与 15K+ token 多模态输入的长上下文。团队针对 TPU 做了词表 padding、懒加载初始化与 StepPool 长上下文等优化,并以余弦相似度验证数值一致性,文本目标阈值 ≥0.999、多模态 ≥0.995。

  2. Claude Blog73

    Claude Cowork 桌面端内置浏览器上线

    Anthropic 在 Claude Cowork 桌面应用中内置浏览器,Claude 可自主导航网页、阅读、点击、填表,本周起向 Pro、Max 和 Team 计划推送,Enterprise 管理员即日起可开启。

    推荐理由:官方说明了内置浏览器与 Claude in Chrome 的分工、登录方式和安全边界,读者可据此判断网页类任务该交给哪条路径。

8月25日周二
  1. Hugging Face Blog69

    Gradio 推出 gr.Workflow:把 AI 管线变成可拖拽、可部署的节点图

    Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。

    推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。

8月21日周五
  1. OpenRouter Announcements62

    OpenRouter 上线 Visual Image Benchmarks 覆盖 39 个图像模型

    OpenRouter 发布 Visual Image Benchmarks,帮助用户评估其平台上的 39 个图像模型(截至 2026 年 8 月)。挑战提示词分七类:不太可能的场景、计数、文字、空间关系、否定、编辑和一致性,结果以网格展示并支持按价格和生成时间排序。视频和音频等更多模态的评估即将推出,用户也可通过 OpenRouter API 或 Chat 试用模型。

    推荐理由:原文给出七类挑战提示词和按价格与生成时间排序的结果网格,读者可直接用它对比 39 个图像模型的真实能力。

  2. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月20日周四
  1. Mistral AI66

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具让模型多步检索、翻阅并验证复杂文档,可通过 Mistral Search Toolkit 及 Studio 和 Vibe 中的 Libraries 使用,无需微调。

    推荐理由:官方给出多步检索循环的完整工具设计和两个基准的具体数字,读者可据此评估它替代一次性 RAG 的适用场景。

8月19日周三
8月18日周二
  1. Claude Platform release notes30

    Claude Console 的 Workbench 更名为 Playground

    Claude Console 的 Workbench 现已更名为 Playground,支持全部 Messages API 参数,并内置演示代码执行、网页搜索等 API 功能的模板。每次运行都会展示完整的 SDK 请求与 API 响应,帮助开发者理解并使用该 API,可在 platform.claude.com/playground 试用。

8月17日周一
  1. OpenRouter Announcements62

    OpenRouter 推出 Activity 仪表盘与 Analytics API,按 Agent、模型和请求分析 AI 用量

    OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。

    推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。

8月13日周四
  1. Google Developers Blog56

    Google 开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials

    Google 发布开源 C++ 库 Credentio,用于处理 C2PA Content Credentials,先支持规范 2.2 和 2.4 版本。该库支持完全本地验证,无需将媒体文件传到云端,零带宽开销、即时返回结果并保持数据隐私;验证大文件时内存占用较小,可配置官方或自定义 C2PA 信任列表,深入解析清单、断言、数字签名和声明结构,并给出详细的验证报告。

  2. Suno Blog65

    Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能

    Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。

    推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。

8月12日周三
  1. Sierra Blog32

    Sierra 推出 Horizon 智能体:把"跟进"变成保险销售的成交环节

    Sierra 的 Horizon 智能体可为保险客户提供长周期主动跟进,从报价到成交持续数天、数周甚至数月,直到客户购买或放弃。文中示例中,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款并演示加购影响,第 7 天完成电话确认,客户当晚即购买保单。Sierra 称该智能体遵循企业及行业最佳实践,沟通内容由企业控制。

  2. Meta Engineering62

    WhatsApp 推出端侧运行的 Scam Alert 反诈骗功能

    WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。

    推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。

8月11日周二
  1. Sierra Blog54

    Sierra 为智能体推出开箱即用的 IVR 电话导航能力

    Sierra 推出开箱即用的 IVR 导航能力,让智能体能打电话穿越多级菜单、判断何时沉默、发送 DTMF 按键音并识别真人接听。评测显示开启该功能后整体通过率提升 49%,从 57% 到 85%,其中「联系到人」类任务提升最大;客户包括一家 top 5 医疗支付方和一家全国性数字药房。