Sierra 推出 Agent Strategist:应用 AI 领域的"博士学位"
Sierra 正在招聘并扩张其增长最快的团队 Agent Strategist,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位使用 Sierra 的 Ghostwriter 等工具,将客户旅程转化为可运行的智能体,并持续优化提示词与流程。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。
Sierra 正在招聘并扩张其增长最快的团队 Agent Strategist,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位使用 Sierra 的 Ghostwriter 等工具,将客户旅程转化为可运行的智能体,并持续优化提示词与流程。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选逆转细胞衰老的基因线索,它扫描数万篇论文后提出 20 多个新颖候选遗传因子,其中数个经实验室验证成功将细胞推向更年轻状态并改善整体功能。Co-Scientist 还将原本需长达六个月的筛选数据分析缩短至几天。
Anthropic 在 Claude Managed Agents 中推出 dreaming 研究预览,并开放 outcomes、多智能体编排和 webhooks。
推荐理由:官方公布了 dreaming、outcomes 与多智能体编排的具体机制和内部基准数据,可了解 Managed Agents 的能力边界与实际收益。
Claude 平台发布更新:MCP tunnels 以研究预览形式上线,可连接私有网络中的 MCP 服务器。
Sierra 构建了一套语音转录平台,通过并行调用多个转录提供商进行集成、注入对话上下文,并支持 70+ 种语言,以解决姓名拼写歧义、行业术语识别等难题。其内部基准显示,集成方案平均将话语错误率降低约 25%,在部分语言中最高降低 37%;上下文感知转录使金融服务智能体的输入验证率提升超 25%,整体问题解决率最高提升 1%,重大转录错误减少最多 15%。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏科研与工程计算。
Runway 工程团队通过一个三行模块的四种并行尝试,展示手工分布式训练中梯度易出静默错误的根因,并说明 PyTorch DTensor 如何用 placement 元数据自动插入正确的 collective 来保证正确性。
Google DeepMind 在 Project Genie 中推出基于 Street View 的世界生成能力,用户可通过 Maps 图钉选择美国地点并叠加 Ocean World、B&W film 等风格,生成起点绑定真实街景的交互式世界,底层由 Maps Imagery Grounding 驱动。
Claude 平台的网页搜索工具现已返回更丰富的 SEC 文件数据,便于金融研究智能体、财报分析和尽职调查工作流基于一手来源并附引用。该更新于 2026 年 5 月 18 日发布。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,锁定值得关注的机制并筛选出候选组合疗法。针对 resmetirom 仅对少数合格患者有效的问题,Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁,该假说随后经实验验证,有望推动靶向双重疗法。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将组织工程与 RNA 表面图谱两套工具结合用于 ALS 研究。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的药物。
推荐理由:原文给出 Co-Scientist 与人类专家选药的真实对比实验结果,读者可以据此了解 AI 辅助药物重定位的实际表现。
Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。
推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。
Runway 宣布进军日本,在东京设立日本总部并投入 4000 万美元初始投资,同时招募日本业务负责人。日本已是 Runway 第三大市场,过去 12 个月企业客户增长 300%,贡献其亚洲销售额的三分之一。Yamaha、SoftBank Corp. 和 NHN 等企业已在营销、广告与创意流程中使用 Runway。
Sierra 发布 𝜏-knowledge,扩展其 𝜏-bench 对话基准,新增 𝜏-Banking 域,包含 698 篇文档、21 个产品类别(约 195K tokens),任务平均需查阅 18.6 篇文档和 9.5 次工具调用。
Runway 推出 Runway Agent,一个智能体创意伙伴,可在单次对话中从想法产出可发布的成品视频,包含多镜头画面、旁白、对白和音乐。用户用自然语言描述需求,可上传参考图、选择画幅比例和时长,逐步对话确定概念与故事结构后生成视频,再用时间线编辑器做最终调整,官方称可在数分钟内产出高分辨率多镜头视频。产品面向品牌团队、营销人员、创意机构、社媒内容团队和影视创作者,现已开放使用。
推荐理由:Runway 官方宣布 Agent 上线并给出工作方式与适用场景,读者可以据此判断对话式视频生产对内容团队的适用度。
Anthropic 在 Claude API 上线缓存诊断公开测试版,请求中传入 diagnostics.previous_message_id 后,API 会返回 cache_miss_reason,说明提示词缓存前缀在何处与上一轮发生偏离。使用该功能需在请求中带上 cache-diagnosis-2026-04-07 beta header。
Claude Opus 4.7 现已支持快速模式(研究预览),可通过设置 speed: "fast"、model: "claude-opus-4-7" 并搭配 fast-mode-2026-02-01 beta header 使用,以显著更快的输出 token 生成速度换取溢价定价。其定价、速率限制和访问权限与 Opus 4.6 快速模式相同,感兴趣的客户需加入等待列表。
Institute for Law & AI 提出“激进可选择性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与模型权重安全等能力。Meta 与 KAIST 的论文提出 Neural Computer,将计算、内存与 I/O 统一在学习到的运行时状态中。
Runway 发布开源 Python 库 confingy 并已上架 PyPI,用于配置 ML 系统,内部已将全部 YAML 配置迁移过去。
Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。
推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。
Runway 发布其儿童安全保护方法,将儿童安全考量融入模型开发、产品部署与用户生成各环节,并与 Thorn 的生成式 AI 安全设计原则对齐。其措施包括用哈希匹配、儿童安全分类器和 LLM 审核过滤训练数据,部署后扫描已知 CSAM 哈希库并人工复核,2025 年向 NCMEC 的 CyberTipline 提交了 516 份报告。此外还引入 C2PA 内容溯源信号,便于识别 AI 生成内容。
一篇综述分析了并行推理领域的最新进展,重点讨论自适应并行推理——让推理模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文章梳理了从自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS 到 ParaThinker、GroupThink、Hogwild! Inference 等方法,指出多数方法仍由外部强加并行结构,而不同问题需要不同并行度。
Sierra 详解其始终在线的评估层 Monitors 如何被评估:每个 monitor 先基于真实对话人工标注的示例定义目标行为,再由多个模型评判并与团队标签比对,分歧处回炉迭代直至模型稳定一致。
Claude Managed Agents 的多智能体编排与 Outcomes 功能进入公测,使用标准 managed-agents-2026-04-01 beta header。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,即决定智能体在每个时刻能访问哪些信息、何时使用。其平台通过渐进式披露机制,仅在条件满足时向智能体提供最少且最相关的信息,避免无关 token 分散模型注意力。
Sierra 宣布融资 9.5 亿美元,由 Tiger Global 和 GV 领投,估值超 150 亿美元,公司可投入资金超过 10 亿美元。
Jack Clark 在 Import AI 455 中判断,到 2028 年底出现无人类参与的 AI 研发(模型自主训练出后继版本)的概率超过 60%,2027 年约为 30%。
Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。
推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。
Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。
Anthropic 在 Claude 平台发布 Workload Identity Federation,可用自家身份提供方(AWS IAM、Google Cloud、GitHub Actions、Kubernetes、Microsoft Entra ID、Okta、SPIFFE 等)签发的短时 OIDC token 认证 Claude API,替代长期静态 API key。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Anthropic 已停用 Claude Sonnet 4.5 和 Claude Sonnet 4 的 1M token 上下文窗口 beta(context-1m-2025-08-07),beta header 对这两个模型不再生效,超过标准 200k token 上下文窗口的请求将返回错误。
DeepSeek-V4-Pro 折扣已延长至 2026 年 5 月 31 日 15:59 UTC!
🔥DeepSeek-V4-Pro API is 75% OFF until May 5th, 2026, 15:59 (UTC Time)! Don't miss out on this massive discount. 🛠️Integration Updates: 🔹Claude Code: Set model to deepseek-v4-pro[1m] to unlock 1M context! 🔹OpenCode: Update to v1.14.24+ 🔹OpenClaw: Update to v2026.4.24+ Check the latest official API docs for full details: https://api-docs.deepseek.com/quick_start/pricing
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。