跳到正文

全部动态

今日 26 条
8月13日周四
  1. Suno Blog65

    Suno Studio 2.0 发布,面向 Premier 订阅者新增 MIDI 编辑与自动化等功能

    Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。

    推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布手语转文本模型 SL2T,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL

    Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。

    推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。

  2. Sierra Blog32

    Sierra 推出 Horizon 智能体:把"跟进"变成保险销售的成交环节

    Sierra 的 Horizon 智能体可为保险客户提供长周期主动跟进,从报价到成交持续数天、数周甚至数月,直到客户购买或放弃。文中示例中,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款并演示加购影响,第 7 天完成电话确认,客户当晚即购买保单。Sierra 称该智能体遵循企业及行业最佳实践,沟通内容由企业控制。

  3. Meta Engineering62

    WhatsApp 推出端侧运行的 Scam Alert 反诈骗功能

    WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。

    推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。

  4. Google Research62

    Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。

    推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。

  5. OpenRouter Announcements65

    OpenRouter 上线实时网络搜索基准:比较引擎、深度与模型的取舍

    OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。

    推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。

  6. Google Research66

    Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。

    推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。

  7. Suno Blog67

    Suno 宣布与 BMG 达成全球合作

    Suno 官方宣布与大型音乐公司 BMG 达成全球合作伙伴关系,该合作是 Suno 即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将共同打造连接艺术家与粉丝的新体验,并为选择加入的艺术家和词曲作者创造新的经济机会,同时深化 Suno: In Session 和 Spark 等对独立艺术家的支持项目。

    推荐理由:Suno 官方宣布与 BMG 达成全球合作,说明合作将伴随其首个与音乐行业共同开发的音乐模型推出,可据此了解 AI 音乐公司与版权方的合作模式。

  8. LMSYS Blog65

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。

    推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。

8月11日周二
  1. Sierra Blog54

    Sierra 为智能体推出开箱即用的 IVR 电话导航能力

    Sierra 推出开箱即用的 IVR 导航能力,让智能体能打电话穿越多级菜单、判断何时沉默、发送 DTMF 按键音并识别真人接听。评测显示开启该功能后整体通过率提升 49%,从 57% 到 85%,其中「联系到人」类任务提升最大;客户包括一家 top 5 医疗支付方和一家全国性数字药房。

  2. Google Developers Blog44

    为什么 Go 是 AI 辅助软件工程的理想语言

    Google 发文论证 Go 是 AI 辅助软件工程的理想语言:当 AI 智能体可秒级生成数百行代码,开发者重心从编写转向审查与维护,语言的可读性和工具链一致性变得更重要。Go 自带格式化、测试框架、依赖管理与安全工具,能让 AI 更快、更便宜、更可靠地处理代码,并减少上下文窗口污染与 token 成本。

8月10日周一
  1. Linear Now60

    Linear 官方解析 Linear Agent 的构建方法:用边界而非固定路径控制 Agent

    Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。

    推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。

  2. Hugging Face Blog81

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。

    推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。

  3. Suno Blog64

    Suno 更新下载政策与服务条款,9月3日起实施下载限额

    Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。

    推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。

  4. LMSYS Blog60

    SGLang 为 Meta Muse Glimmer 提供 Day-0 支持,面向本地智能体工作流的多模态模型

    SGLang 与 Meta Superintelligence Labs 合作,为 Muse Glimmer 提供 Day-0 支持。Muse Glimmer 是 30B 参数多模态稠密模型,拥有 128k+ token 上下文窗口,架构含 27.9B 文本解码器、1.9B ViT 和多模态 projector。

    推荐理由:原文给出多平台实测吞吐与量化方案,读者可据此评估在本地硬件跑智能体工作流的可行性。

8月8日周六
  1. Sierra Blog45

    Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格

    Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,可跨品牌、市场与语言复用同一底层智能体。该功能结合语音、个性与语言感知行为,支持智能体在对话中调整语速、应对打断并切换语音或语言,由多种语音模型按场景择优驱动。Sierra 称某智能体搭配自然语音与人格后解决率提升近 50%,Voice Personas 现已上线。

8月7日周五
8月6日周四
  1. Google DeepMind83

    Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文显示精度领先一天

    Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。

    推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。

  2. OpenRouter Announcements61

    OpenRouter 讲解如何治理团队 AI 支出的 6 项控制

    OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。

    推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。

  3. Runway News49

    Chime 如何用 Runway 制作最新全国电视广告

    Chime 用 Runway 完成最新全国电视广告的结尾画面,将 85 位以上真实会员照片生成稳定、可播出的动态网格画面。执行制片人 Shayla Love 称,这一原本需要 80 多人实拍、成本约为传统方式 5 倍的场景,靠传统拍摄几乎无法落地。团队还计划把 Runway 用于概念分镜和品牌图片生成。

  4. Suno Blog51

    Suno 阐述负责任构建音乐 AI 的原则并推出下载新政与透明度工具

    Suno 发布官方声明,阐述支持艺术家、鼓励原创而非模仿、维护音乐生态等核心原则,并宣布相关行动。具体包括训练元数据不使用艺术家名、禁止特定艺术家或受版权保护歌曲的提示词、即将推出限制大规模分发歌曲到流媒体平台的下载政策、开始部署透明度工具及音频水印与指纹技术,并更新社区准则以更明确禁止伪造歌曲、未经授权上传和冒用他人声音等行为。

8月5日周三
  1. Claude Platform release notes48

    Claude Enterprise 推出 Inference hooks 测试版,Claude Opus 4.1 退役

    Anthropic 为 Claude Enterprise 组织推出 Inference hooks 测试版,可将 Claude 指向企业自有 AI 安全服务器,claude.ai、Cowork 和 Claude Code 中每个受管控提示词都需等待服务器放行或拒绝后才继续推理,请求经过签名、失败处理可配置,每次拒绝都会记录在合规 Activity Feed 中。

8月4日周二
  1. Mistral AI64

    Mistral AI 开源 3B 多模态安全分类器 Shieldstral

    Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。

    推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。