跳到正文

#Agent

今日 12 条
今天10月2日周五
  1. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  2. Hugging Face Blog43

    AutoSynthData:为 Enterprise Agents 生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。

  3. Google Cloud: Databases61

    Google Cloud Data Agent Kit 正式 GA,支持 BigQuery Graph、Bigtable 与 Spark 访问 Lakehouse

    Google Cloud 宣布 Data Agent Kit 正式 GA,这是一套免费的 MCP 工具与智能体技能,可让 Claude Code、Codex、Antigravity 等编码智能体直接操作 Google Data Cloud 数据服务。

    推荐理由:官方公告给出 GA 新增的数据服务支持和开源技能机制,读者可以据此评估自己的编码智能体如何接入 Google 数据栈。

  4. Google Cloud: Databases66

    Google 威胁情报 group 报告:AI 时代漏洞披露翻倍、高危漏洞利用激增

    Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。

    推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。

  5. Claude Blog73

    Claude Code 推出 mods:用 TypeScript 函数定制和替换内置功能

    Anthropic 为 Claude Code 推出 mods,即小型 TypeScript 函数,可改写提示词、拦截工具调用、审批权限请求或添加新 UI。Mods 随插件分发,可在 CLI 和桌面应用使用,内置的 /diff 功能已改为 mod。

    推荐理由:官方公布了 mods 的事件机制、企业管控方式和使用入口,开发者可据此决定是否用 mods 定制自己的 Claude Code 工作流。

  6. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

10月1日周四
  1. Databricks Blog25

    Databricks 谈智能体营销:如何把客户上下文连接到可衡量的 ROI

    Databricks 提出以智能体营销打通客户上下文与可衡量 ROI,强调身份解析是基础:Acxiom 与 Lovelytics 合作将其数据与身份服务重建为 Databricks 上的原生应用层,可执行客户洞察的上市时间提升约 30%、运营成本降低约 15%,Acxiom 的 Real ID 身份解析引擎也已原生运行在 Databricks 上。

  2. Claude Code GitHub Releases36

    Claude Code v2.1.286 发布

    Claude Code v2.1.286 发布,权限提示新增“2 of 5”计数,全屏列表的“N more”行支持鼠标点击跳转。本次修复涵盖多进程重复打开登录浏览器、claude --resume 与 --continue 丢失并行工具调用轮次、工具返回对象或数字导致的 API 400 错误,以及云会话因容器停止而无法唤醒等问题。

  3. Databricks Blog30

    Databricks 如何规模化智能体应用而不造成 AI 蔓延

    Databricks 联合 OpenAI 和 Stellantis 探讨企业规模化智能体应用,核心是随智能体自主性提升,周边基础设施更关键,需提供模型与框架选择、受治理的企业上下文、以及贯穿每次行动的控制。Databricks 以 Agent Bricks、Omnigent 和 Unity Gateway 构建统一底座,让团队新增智能体和工作流时无需各自重复集成与治理。

  4. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

  5. Anthropic Research73

    物理学家 Schwartz 分享用 Claude 与 BootLoops 做跨领域定量科学的方法与成果

    物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。

    推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。

9月30日周三
  1. OpenRouter Announcements70

    OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试

    OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。

    推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。

  2. Claude Blog55

    Anthropic 销售团队如何用 Claude Managed Agents 重建 inbound 销售

    Anthropic 销售团队基于 Claude Managed Agents (beta) 构建了购买智能体,每天处理数千次对话,引导客户从咨询到完成购买,升级给销售的线索转化率是旧表单的两倍多,成交快约五天。底层只有一个提示词、少量工具和 Claude,一名工程师几周就完成初版;经验包括给目标而非规则、提示词从简、把升级给销售的每一次当作改进反馈,需要人工介入的对话占比已降约一半。

9月29日周二
  1. Microsoft Research61

    Microsoft Research 发布生物研究领域 AI 系统 Quine

    Microsoft Research 推出 Quine,一个面向生物学的多模态世界模型与交互式 harness,连接科学工具、文献和研究人员。在与 Broad Institute 合作中,Quine 用于预测可驱动胰腺癌肿瘤细胞状态转变的化合物,排名第一的候选化合物在湿实验中产生了最大的预期细胞状态转变,从缩小化合物范围到确定候选名单仅用了一个周末。

    推荐理由:官方披露了系统构成和胰腺癌湿实验验证结果,读者可以据此评估AI世界模型在生物研究中的实际作用。