跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 201–220 条 · 共 233 条
5月6日周三
5月5日周二
  1. Anthropic Newsroom63

    Anthropic 发布十款金融服务智能体模板并接入 Microsoft 365

    Anthropic 发布十款面向金融服务的开箱即用智能体模板,覆盖 pitchbook 制作、KYC 筛查和月末结账等耗时工作,以 Claude Cowork、Claude Code 插件及 Claude Managed Agents 的 cookbook 形式提供。

    推荐理由:原文给出了十类金融智能体模板的构成与接入方式,读者可据此判断其在投研与合规流程中的落地路径。

5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月30日周四
  1. Claude Blog64

    构建 Claude Code 的经验:提示词缓存决定一切

    Claude Code 团队发文总结围绕提示词缓存构建智能体的工程经验,核心是提示词缓存按前缀匹配,前缀中任何改动都会使其后的缓存失效,因此要把静态内容放前面、动态内容放后面。

    推荐理由:Claude Code 团队公开了围绕提示词缓存设计智能体的具体取舍,可迁移到自建 Agent 的提示词组织与工具管理。

4月28日周二
  1. inclusionAI Hugging Face models62

    inclusionAI 发布 DR-Venus-4B-SFT 深度研究智能体模型

    inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。

    推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。

  2. Claude Blog65

    华盛顿大学 MacCoss 实验室用新开发者入职法让 Claude Code 接管 70 万行遗留代码

    华盛顿大学 MacCoss 实验室的 Brendan MacLean 将17年培养新开发者的入职方法应用于 Claude Code,把 AI 上下文放入独立仓库 pwiz-ai,用 CLAUDE.md、技能库和 MCP 集成管理 70 万行 C# 的 Skyline 代码库。

    推荐理由:原文给出维护17年、70万行C#代码库的上下文分层和技能库方法,对长期项目接入 Claude Code 有可迁移的参考。

4月24日周五
  1. OpenRouter Announcements65

    用 Agent SDK 构建自己的编码智能体 Harness

    OpenRouter 发布教程,介绍用 create-agent-tui 和 create-headless-agent 两个 skill 在几分钟内搭建个性化的编码智能体。两种 skill 分别对应终端界面和无头模式,后者可用于脚本与流水线。

    推荐理由:原文给出两个 skill 的用法,读者据此可在几分钟内搭出带终端界面或无头运行的编码智能体。

  2. @TencentHunyuan66

    腾讯混元宣布 Hy3-Preview 已在 OpenRouter 上线,5 月 8 日前可免费试用。据 OpenRouter 介绍,该模型为 295B MoE 架构(21B 激活参数),支持可控推理强度,在编码智能体场景表现较强并具备全面通用能力。

    引用OpenRouter (@OpenRouter)@OpenRouter

    The new Hy3-Preview model from @TencentHunyuan is live for free on OpenRouter! It’s a 295B MoE model (21B active) with controllable reasoning effort. A cost-effective, practical model that performs strongly in coding agents and delivers comprehensive general capabilities.

    推荐理由:腾讯混元 Hy3-Preview 上线 OpenRouter 并限时免费,读者可了解其 MoE 规模与可控推理强度设定。

4月23日周四
  1. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

4月22日周三
  1. Sierra Blog61

    Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试

    Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。

    推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。

  2. OpenAI News72

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体,这类智能体由 Codex 驱动,可自动化复杂工作流。它们运行在云端,帮助团队跨工具安全地扩展工作。

    推荐理由:官方说明了工作区智能体由 Codex 驱动并在云端运行,读者可据此判断它与现有团队工作流的衔接方式。