AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。
Google Cloud 宣布 Data Agent Kit 正式 GA,这是一套免费的 MCP 工具与智能体技能,可让 Claude Code、Codex、Antigravity 等编码智能体直接操作 Google Data Cloud 数据服务。
推荐理由:官方公告给出 GA 新增的数据服务支持和开源技能机制,读者可以据此评估自己的编码智能体如何接入 Google 数据栈。
Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。
推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。
Google Cloud 宣布可任意部署的分布式多模型数据库 Spanner Omni 正式可用,支持本地数据中心、多云、Kubernetes 乃至笔记本环境,发布以来下载量超过 200 万。
Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。
推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。
OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。
推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。
OpenRouter 发文将多模型编排拆为三层:工作流编排(LangGraph、CrewAI 负责)、模型路由和提供商路由(OpenRouter 负责)。
AWS Professional Services 构建的四智能体模式在 Amazon Bedrock AgentCore 上运行,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该模式已在一个覆盖 300+ 应用的迁移项目中验证。
AWS 博客发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT 1.6)的自定义记忆后端,并部署在 Amazon EKS 上。
AWS 发布基于 Amazon Bedrock AgentCore 的环境智能体(ambient agent)参考实现,用 S3 上传等事件自动触发 agent 任务,替代等待用户输入的聊天模式。
Databricks 提出以智能体营销打通客户上下文与可衡量 ROI,强调身份解析是基础:Acxiom 与 Lovelytics 合作将其数据与身份服务重建为 Databricks 上的原生应用层,可执行客户洞察的上市时间提升约 30%、运营成本降低约 15%,Acxiom 的 Real ID 身份解析引擎也已原生运行在 Databricks 上。
Chrome Enterprise Premium 通过直接在用户交互点采集浏览器遥测数据,填补传统 EDR 和防火墙对浏览器内交互的可见性盲区。其能力包括网络事件与高风险行为的实时信号、侧载扩展的细粒度遥测、GenAI 与 SaaS 应用发现治理,以及留存违反 DLP 策略内容的证据库。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表的“N more”行支持鼠标点击跳转。本次修复涵盖多进程重复打开登录浏览器、claude --resume 与 --continue 丢失并行工具调用轮次、工具返回对象或数字导致的 API 400 错误,以及云会话因容器停止而无法唤醒等问题。
Runway 发布新产品 Runway Ads,连接广告账户和品牌套件后可生成视频与图像广告创意,直接发布到 Meta、Google 和 TikTok,并读取平台表现数据迭代下一轮创意。
推荐理由:Runway 官方发布并给出自身投放数据,读者可以据此评估端到端生成式投放工具对营销工作流的实际改变。
Databricks 发布 AI Function ai_decide,基于 TypeSafe AI 的决策模型 Jev,对非结构化文本在不到一秒内返回概率、命名选项或有序评分,延迟和成本低于 LLM。
Databricks 联合 OpenAI 和 Stellantis 探讨企业规模化智能体应用,核心是随智能体自主性提升,周边基础设施更关键,需提供模型与框架选择、受治理的企业上下文、以及贯穿每次行动的控制。Databricks 以 Agent Bricks、Omnigent 和 Unity Gateway 构建统一底座,让团队新增智能体和工作流时无需各自重复集成与治理。
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Google Cloud 9 月为应对智能体规模化需求更新 AI 基础设施与编排能力,推出开源 GKE Agent Substrate,可运行数百万个沙箱,密度达标准容器运行时 10 倍,支持每秒超 500 次挂起/恢复且恢复低于 500ms。
Google Cloud 发布 Google Cloud CLI 远程 MCP server 预览版,将 gcloud 和 bq(BigQuery)命令行工具封装为 run_gcloud_command 和 run_bq_command 两个工具,供 AI 智能体在 Google Cloud 托管的隔离沙箱中执行云端基础设施管理和高级 BigQuery 工作流。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统搭配 Spectrum-X 102.4T 以太网正式可用,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户。
OpenRouter 发布教程,讲解如何测试 Agent 的工具调用准确性,核心是分开测试工具选择与参数正确性这两类失败。
推荐理由:原文区分了工具选择错误与参数错误两类失败模式,并给出 LLM judge、JSON Schema 校验和轨迹比较三种可落地的测试方法。
OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。
推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
Google Cloud 正式发布面向智能体强化学习的 GKE Agent Sandbox、Agent Sandbox RL 编排 SDK 及主流 RL gym 与 harness 原生集成。
基于 Amazon Bedrock AgentCore 的合同智能平台用 AI 智能体从合同 PDF 中提取八个关键字段,由 Claude Sonnet 系列模型负责抽取、Claude Haiku 独立复核,签名识别分歧时交由 Amazon Textract 用计算机视觉做确定性裁决。
Anthropic 宣布 Claude for Government 面向美国联邦与州级机构正式可用,该平台通过 FedRAMP High 授权环境提供 Claude 的编码与智能体工作能力,此前自 7 月起处于公开测试阶段。
Anthropic 销售团队基于 Claude Managed Agents (beta) 构建了购买智能体,每天处理数千次对话,引导客户从咨询到完成购买,升级给销售的线索转化率是旧表单的两倍多,成交快约五天。底层只有一个提示词、少量工具和 Claude,一名工程师几周就完成初版;经验包括给目标而非规则、提示词从简、把升级给销售的每一次当作改进反馈,需要人工介入的对话占比已降约一半。
Google Cloud 团队发文详解 Agent Development Kit(ADK)的 Workflow 图编排能力,通过一个退款流程示例演示 fan-out/fan-in、确定性路由与 agent 路由、RequestInput 人工审核暂停、parallel_worker 批量处理以及 ctx.run_node 动态编排等模式。
Google Cloud 在 Gemini Enterprise 中扩充了合作伙伴构建的安全智能体与 AI 防御产品目录,覆盖 Acalvio、Britive、Check Point、CrowdStrike、Cyberhaven、Cyera、Endor Labs、Exabeam、Fastly、Fortinet 等厂商。
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
OpenAI 推出 dots,一种可跨复杂项目与日常任务持续推进工作的主动式助手。dots 让用户在任务推进过程中保持掌控。