AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。
Google Cloud 宣布 Data Agent Kit 正式 GA,这是一套免费的 MCP 工具与智能体技能,可让 Claude Code、Codex、Antigravity 等编码智能体直接操作 Google Data Cloud 数据服务。
推荐理由:官方公告给出 GA 新增的数据服务支持和开源技能机制,读者可以据此评估自己的编码智能体如何接入 Google 数据栈。
Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。
推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。
Google Cloud 宣布可任意部署的分布式多模型数据库 Spanner Omni 正式可用,支持本地数据中心、多云、Kubernetes 乃至笔记本环境,发布以来下载量超过 200 万。
Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。
推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。
社交俱乐部 The Den 在新店开业之际,用 ChatGPT Work 将拨款申请的准备时间从 3 天压缩到 2 小时,酒牌材料从 4 天压缩到 3 小时,每周因此省出 10-15 小时用于业务增长。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物体验更轻松。
OpenAI 发文探讨先进 AI 对突破性创意背后日常工作的价值,认为执行环节可能决定下一阶段经济的形态与进步速度。文章未给出具体模型、参数或评测数据,核心观点是 AI 在常规执行类任务上的作用可能比创意本身更具影响力。
OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。
推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。
OpenRouter 发文将多模型编排拆为三层:工作流编排(LangGraph、CrewAI 负责)、模型路由和提供商路由(OpenRouter 负责)。
OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。
OpenAI 发布 GPT-6 Astra Ultrafast,运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用。
推荐理由:原文给出 Ultrafast 模式相对 Astra Standard 的加速幅度和适用场景,开发者可据此评估 coding agent 工作流的收益。
AWS Professional Services 构建的四智能体模式在 Amazon Bedrock AgentCore 上运行,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该模式已在一个覆盖 300+ 应用的迁移项目中验证。
Apache Iceberg 社区为 Iceberg REST Catalog 推进两项新规范:read restrictions 与 catalog labels。
Amazon Quick 为 AI 构建的 Quick Apps 推出 Live Data in Apps,应用每次打开时都会实时查询受治理的 Quick Sight 数据集,不再依赖发布时的静态快照。
Claude Code 发布 v2.1.287,新增 Claude Mods 插件机制和内置 mod "You should know",Opus 4.7+ 与 Fable 在 Bedrock、Vertex、Foundry 等默认使用 1M 上下文窗口。另修复大量问题,包括 rm 危险命令保护、屏幕阅读器模式和 VSCode 扩展的多项缺陷,并改进 Bash 速度与 MCP 权限提示展示。
Databricks 的 Lakebase Postgres 推出基于分支的恢复机制,将恢复时间从数小时降至秒级,即使数据库规模达 100 TB。该架构将计算与存储解耦,数据库历史以可即时引用的形式存放在对象存储中,恢复只需在指定时间戳创建一个分支,属于元数据操作而非数据拷贝与 WAL 重放。
AWS 博客发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT 1.6)的自定义记忆后端,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。
AWS 发布基于 Amazon Bedrock AgentCore 的环境智能体(ambient agent)参考实现,用 S3 上传等事件自动触发 agent 任务,替代等待用户输入的聊天模式。
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,采用专用 AI Services 账户承载订阅与工作区,通过跨账户 SigV4、工作区级 API key 和 OIDC 联合三种方式分别接入 AWS 工作负载、开发者笔记本和外部 CI/CD。生产与开发流量以独立工作区隔离,共享同一订阅,AWS 工作负载无需存储或轮换密钥。
PayPal 将分析负载从本地 Hadoop 迁移到 Google 的 Managed Service for Apache Spark,核心分析任务处理时间缩短 25%,SLA 达标率提升 30%。该服务支持分钟级集群部署与弹性扩缩容,并原生对接 GCS 和 BigQuery,帮助 PayPal 整合分散的批处理流程、降低运维成本。
Microsoft AI 发布实时流式转写模型 MAI-Transcribe-2-Streaming,在 Artificial Analysis 的最终与部分转写准确率均排名第一,支持 60 种语言,接收到音频后约 100ms 内产出首个 partials,内部评测显示实时听写场景出词速度比最接近的竞品快 2x,年底前 introductory 价 $0.54 每小时音频。
推荐理由:官方公布三款语音模型的具体定价、延迟数字和 Artificial Analysis 排名,可据此评估搭建语音智能体的成本与速度。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其适配自身零售审核策略。
Ai2 发布 Olmo-core 3,为 Olmo 框架带来重新设计的开源 MoE 训练系统,可扩展到万亿参数规模并保持计算效率。新实现从 FSDP 切换到基于 DDP 的方案,47B 参数 MoE 在 8 张 NVIDIA B300 上达到每 GPU 每秒 52,000 tokens,约为旧实现的 2.7 倍;启用 MXFP8 后吞吐比 BF16 高约 21%。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 分之一。
Google Cloud Managed Lustre 新增 Dynamic Tier,以 6 美分/GB*月提供热数据亚毫秒延迟,容量可线性扩展至 80 PB,且不单独收取介质、数据移动和元数据 IOPS 费用。该层支持多轮训练、写入密集检查点、快速检查点恢复和交互式开发,平均读延迟约 300µs,比替代分布式文件系统响应快至 4 倍。
Databricks 提出以智能体营销打通客户上下文与可衡量 ROI,强调身份解析是基础:Acxiom 与 Lovelytics 合作将其数据与身份服务重建为 Databricks 上的原生应用层,可执行客户洞察的上市时间提升约 30%、运营成本降低约 15%,Acxiom 的 Real ID 身份解析引擎也已原生运行在 Databricks 上。
Chrome Enterprise Premium 通过直接在用户交互点采集浏览器遥测数据,填补传统 EDR 和防火墙对浏览器内交互的可见性盲区。其能力包括网络事件与高风险行为的实时信号、侧载扩展的细粒度遥测、GenAI 与 SaaS 应用发现治理,以及留存违反 DLP 策略内容的证据库。
Google Cloud 推出官方 Swift API 客户端库 google-cloud-swift,基于 Swift 6.2+ 构建,采用 Swift NIO 事件循环、HTTP/2 多路复用与 gRPC 传输,并支持编译期数据竞争安全。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。
推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表的“N more”行支持鼠标点击跳转。本次修复涵盖多进程重复打开登录浏览器、claude --resume 与 --continue 丢失并行工具调用轮次、工具返回对象或数字导致的 API 400 错误,以及云会话因容器停止而无法唤醒等问题。
Runway 发布新产品 Runway Ads,连接广告账户和品牌套件后可生成视频与图像广告创意,直接发布到 Meta、Google 和 TikTok,并读取平台表现数据迭代下一轮创意。
推荐理由:Runway 官方发布并给出自身投放数据,读者可以据此评估端到端生成式投放工具对营销工作流的实际改变。