Mistral 在 Studio 中推出 Connectors,支持内置连接器与自定义 MCP
Mistral 发布 Studio 的 Connectors(Public Preview),内置连接器和自定义 MCP 可通过 API/SDK 用于所有模型与 Agent 调用。
Mistral 发布 Studio 的 Connectors(Public Preview),内置连接器和自定义 MCP 可通过 API/SDK 用于所有模型与 Agent 调用。
Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。
推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选逆转细胞衰老的基因线索,它扫描数万篇论文后提出 20 多个新颖候选遗传因子,其中数个经实验室验证成功将细胞推向更年轻状态并改善整体功能。Co-Scientist 还将原本需长达六个月的筛选数据分析缩短至几天。
Anthropic 在 Claude Managed Agents 中推出 dreaming 研究预览,并开放 outcomes、多智能体编排和 webhooks。
推荐理由:官方公布了 dreaming、outcomes 与多智能体编排的具体机制和内部基准数据,可了解 Managed Agents 的能力边界与实际收益。
Claude 平台发布更新:MCP tunnels 以研究预览形式上线,可连接私有网络中的 MCP 服务器。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
Google DeepMind 在 Project Genie 中推出基于 Street View 的世界生成能力,用户可通过 Maps 图钉选择美国地点并叠加 Ocean World、B&W film 等风格,生成起点绑定真实街景的交互式世界,底层由 Maps Imagery Grounding 驱动。
Claude 平台的网页搜索工具现已返回更丰富的 SEC 文件数据,便于金融研究智能体、财报分析和尽职调查工作流基于一手来源并附引用。该更新于 2026 年 5 月 18 日发布。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,锁定值得关注的机制并筛选出候选组合疗法。针对 resmetirom 仅对少数合格患者有效的问题,Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,有望推动靶向双重疗法。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将组织工程与 RNA 表面图谱两套工具结合用于 ALS 研究。
Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。
推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。
Runway 推出 Runway Agent,一个智能体创意伙伴,可在单次对话中从想法产出可发布的成品视频,包含多镜头画面、旁白、对白和音乐。用户用自然语言描述需求,可上传参考图、选择画幅比例和时长,逐步对话确定概念与故事结构后生成视频,再用时间线编辑器做最终调整,官方称可在数分钟内产出高分辨率多镜头视频。产品面向品牌团队、营销人员、创意机构、社媒内容团队和影视创作者,现已开放使用。
推荐理由:Runway 官方宣布 Agent 上线并给出工作方式与适用场景,读者可以据此判断对话式视频生产对内容团队的适用度。
Anthropic 在 Claude API 上线缓存诊断公开测试版,请求中传入 diagnostics.previous_message_id 后,API 会返回 cache_miss_reason,说明提示词缓存前缀在何处与上一轮发生偏离。使用该功能需在请求中带上 cache-diagnosis-2026-04-07 beta header。
Claude Opus 4.7 现已支持快速模式(研究预览),可通过设置 speed: "fast"、model: "claude-opus-4-7" 并搭配 fast-mode-2026-02-01 beta header 使用,以显著更快的输出 token 生成速度换取溢价定价。其定价、速率限制和访问权限与 Opus 4.6 快速模式相同,感兴趣的客户需加入等待列表。
Runway 发布开源 Python 库 confingy 并已上架 PyPI,用于配置 ML 系统,内部已将全部 YAML 配置迁移过去。
Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。
推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。
Sierra 详解其始终在线的评估层 Monitors 如何被评估:每个 monitor 先基于真实对话人工标注的示例定义目标行为,再由多个模型评判并与团队标签比对,分歧处回炉迭代直至模型稳定一致。
Claude Managed Agents 的多智能体编排与 Outcomes 功能进入公测,使用标准 managed-agents-2026-04-01 beta header。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Anthropic 在 Claude 平台发布 Workload Identity Federation,可用自家身份提供方(AWS IAM、Google Cloud、GitHub Actions、Kubernetes、Microsoft Entra ID、Okta、SPIFFE 等)签发的短时 OIDC token 认证 Claude API,替代长期静态 API key。
Anthropic 已停用 Claude Sonnet 4.5 和 Claude Sonnet 4 的 1M token 上下文窗口 beta(context-1m-2025-08-07),beta header 对这两个模型不再生效,超过标准 200k token 上下文窗口的请求将返回错误。
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Anthropic 为 Claude 平台推出 Rate Limits API,管理员可通过编程方式查询其组织与工作区已配置的速率限制。
Google 宣布在 Google Photos 的 Auto frame 功能中推出新的拍照后视角调整方法,通过 ML 模型理解场景空间布局并用生成式 AI 从新视角重构成像。
推荐理由:原文解释了两阶段 3D 场景重建加生成补全的技术路线,读者可以了解它与传统裁剪编辑的本质差别。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排),用于其客服 AI 智能体,解决率最高提升 16 个百分点。Linnaeus 直接处理完整对话,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责精准筛选,使搜索成本与 P90 延迟均下降超 75%。
Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。
Runway 推出面向早期创业公司的 Runway Builders 计划,为 Seed 至 Series C 阶段公司提供最高 50 万免费 API credits、最高速率限制及 Runway Characters 的早期访问权限。
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。
Sierra 推出以智能体构建智能体为核心的重构产品 Ghostwriter,用户上传 SOP、客服通话记录、白板草图等素材或用英文描述需求,即可生成支持语音、聊天、邮件和 30 多种语言、自带护栏的生产级智能体。
Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。
推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。
Google 推出 Vibe Coding XR 工作流,通过专门的系统提示词与 XR Blocks 代码模板,让 Gemini 将自然语言在 60 秒内转为可运行的、支持物理感知的 Android XR 应用。
Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。
Miles 开源强化学习框架现已支持 ROCm,可在 AMD Instinct MI300/350 系列 GPU 上原生运行大规模 RL 后训练。该框架基于 SGLang 和 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。
推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。