AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。
推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。
OpenRouter 发文将多模型编排拆为三层:工作流编排(LangGraph、CrewAI 负责)、模型路由和提供商路由(OpenRouter 负责)。
OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。
OpenAI 发布 GPT-6 Astra Ultrafast,运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用。
推荐理由:原文给出 Ultrafast 模式相对 Astra Standard 的加速幅度和适用场景,开发者可据此评估 coding agent 工作流的收益。
Claude Code 发布 v2.1.287,新增 Claude Mods 插件机制和内置 mod "You should know",Opus 4.7+ 与 Fable 在 Bedrock、Vertex、Foundry 等默认使用 1M 上下文窗口。另修复大量问题,包括 rm 危险命令保护、屏幕阅读器模式和 VSCode 扩展的多项缺陷,并改进 Bash 速度与 MCP 权限提示展示。
Databricks 的 Lakebase Postgres 推出基于分支的恢复机制,将恢复时间从数小时降至秒级,即使数据库规模达 100 TB。该架构将计算与存储解耦,数据库历史以可即时引用的形式存放在对象存储中,恢复只需在指定时间戳创建一个分支,属于元数据操作而非数据拷贝与 WAL 重放。
AWS 博客发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT 1.6)的自定义记忆后端,并部署在 Amazon EKS 上。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。
AWS 发布基于 Amazon Bedrock AgentCore 的环境智能体(ambient agent)参考实现,用 S3 上传等事件自动触发 agent 任务,替代等待用户输入的聊天模式。
PayPal 将分析负载从本地 Hadoop 迁移到 Google 的 Managed Service for Apache Spark,核心分析任务处理时间缩短 25%,SLA 达标率提升 30%。该服务支持分钟级集群部署与弹性扩缩容,并原生对接 GCS 和 BigQuery,帮助 PayPal 整合分散的批处理流程、降低运维成本。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其适配自身零售审核策略。
Ai2 发布 Olmo-core 3,为 Olmo 框架带来重新设计的开源 MoE 训练系统,可扩展到万亿参数规模并保持计算效率。新实现从 FSDP 切换到基于 DDP 的方案,47B 参数 MoE 在 8 张 NVIDIA B300 上达到每 GPU 每秒 52,000 tokens,约为旧实现的 2.7 倍;启用 MXFP8 后吞吐比 BF16 高约 21%。
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 分之一。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。
推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。
Runway 发布新产品 Runway Ads,连接广告账户和品牌套件后可生成视频与图像广告创意,直接发布到 Meta、Google 和 TikTok,并读取平台表现数据迭代下一轮创意。
推荐理由:Runway 官方发布并给出自身投放数据,读者可以据此评估端到端生成式投放工具对营销工作流的实际改变。
Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
Google Cloud 9 月为应对智能体规模化需求更新 AI 基础设施与编排能力,推出开源 GKE Agent Substrate,可运行数百万个沙箱,密度达标准容器运行时 10 倍,支持每秒超 500 次挂起/恢复且恢复低于 500ms。
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。
推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。
OpenRouter 发布教程,讲解如何从生产流量构建 golden eval 数据集,用于在每次部署前检测提示词或模型变更引起的回归。内容涵盖五步流程:抽样生产流量、去重聚类、添加经审核的预期输出、首轮评估修正评分标准、纳入 Git 与 CI,建议探索性问题约 10 条、完整回归集 100 到 1,000 条,并以生产数据为基础、合成数据补足覆盖缺口。
推荐理由:原文给出从生产流量构建评测集的五步流程和规模建议,可迁移到自己的模型回归测试工作流。
Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。
推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。
Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。
推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。
Databricks 发布 Lakebase Search,通过 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展为 Lakebase Postgres 带来搜索能力,已在 AWS 和 Azure 正式可用。
Databricks 提出用 Data and AI Platform 打通制造业产品价值链,让跨阶段数据问题从人工查票变成一次查询。平台通过 zero-copy Open Sharing 和 Lakehouse Federation 直接访问源系统数据,无需为每个用例新建 ETL 管道或复制数据;需要镜像时可用连接器和云对象存储汇入 lakehouse。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更聪明高效、多数任务单次成本更低且速度更快的编码与知识工作模型。
推荐理由:官方介绍了 Sonnet 5.5 在 Bedrock 的能力定位、与 Opus 5.5 的分工和入门调用方式,方便评估接入路径。
Mistral 宣布在慕尼黑设立新 hub,组建 Physics AI 和工业 AI 专门研究团队并服务企业客户,同时计划到 2030 年建成 1 GW 欧洲算力。
Google Cloud 在 Compute Engine 上正式开放存储优化型 Z4D 机器系列,提供 VM 与裸金属实例,搭载第五代 AMD EPYC(Turin)处理器,最高 84,000 GiB 本地 SSD、384 vCPU 和 3,072 GiB 内存。
OpenRouter 推出 Security Center,可在设置 > Security 下跨工作区查看所有 API key、识别风险 key,并支持一次最多 500 个批量禁用、归档或设置消费上限,所有套餐可用。
推荐理由:OpenRouter 以自家 85 名员工 1000 多个 key 的审计为参照,介绍了安全中心的清理建议、风险评分和批量操作方法。
Anthropic 发布 Claude Sonnet 5.5(claude-sonnet-5-5),可在 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方列出了五类从 Claude Sonnet 5 升级会破坏的代码场景和迁移指引,方便开发者提前排查自己的 API 调用。
Runway Dev 的 Model Router 可按成本、质量或延迟偏好为每次请求自动选模型,其评测显示质量优化路由在 250 条图生视频提示上把单条成本从 Seedance 2.5 基线的 $1.80 降至 $1.28(-29%),可用率 77% 对 78%。
SGLang 的 /v1/score 接口让调用方通过 label_token_ids 显式声明所需标签分数,避免依赖生成响应 top-k logprobs 中是否出现该标签。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 设备端)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。
推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。
inclusionAI 基于 Ling 2.0 架构正式发布 Ring-mini-2.0,总参数 16.8B、激活参数仅 1.4B,经 Long-CoT SFT。
inclusionAI 正式开源思考模型 Ring-flash-2.0,总参数 100B、每次推理仅激活 6.1B,基于 Ling-flash-2.0-base 深度优化。
推荐理由:官方发布完整披露了 icepop 算法、多阶段 RL 训练流程和部署参数,读者可以评估其推理性价比与可复现性。
inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。
推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。