跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 421–440 条 · 共 847 条
8月17日周一
  1. Mistral AI66

    Mistral 为 le Chat 加入联网搜索、Canvas 与 Pixtral Large 多模态能力

    Mistral AI 为 le Chat 上线多项 beta 功能,包括带引用的联网搜索、Canvas 协作编辑、Pixtral Large 支持的文档与图像理解,以及由 Black Forest Labs Flux Pro 提供支持的图像生成。用户还可把复用的提示词固化为可分享的 Agent。这些功能目前免费开放,并将在未来几周逐步推送。

    推荐理由:官方列出 le Chat 与 ChatGPT、Perplexity、Claude 的功能对照,并说明这些能力当前以免费 beta 提供。

  2. Claude Blog65

    Claude Code 自动模式成为默认设置,Anthropic 公布生产环境实践

    Claude Code 的自动模式现已改为默认设置,由分类器评估每个待执行动作并拦截可能有害的命令,取代逐条人工批准权限提示。Anthropic 称内部评估中分类器发现的危险操作多于开发者手动点击批准时,且在第三方红队测试下表现稳定;由于会话打断更少,Claude 在两次中断之间的连续工作时间是此前默认设置的 9 倍。

    推荐理由:官方给出自动模式在 Nuro、Gusto、Garner Health 生产环境的落地细节,可了解分类器在速度与安全之间的取舍。

  3. OpenRouter Announcements62

    OpenRouter 推出 Activity 仪表盘与 Analytics API,按 Agent、模型和请求分析 AI 用量

    OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。

    推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。

8月16日周日
  1. LangChain Blog62

    LangChain 的 Managed Deep Agents 进入公开测试

    LangChain 宣布 Managed Deep Agents 进入公开测试,开发者可用 Python 或 TypeScript 编写 Deep Agent 并本地测试,再用 mda deploy 一条命令部署到 LangSmith 托管运行时。

    推荐理由:原文列出托管运行时接管的持久化、沙箱与记忆等基础设施,并说明用户仍可控制的部分,便于判断是否把原型迁到生产。

  2. LangChain Blog71

    LangChain 实测 Switchyard 路由:仅 7% 的 agent 调用需要前沿模型

    LangChain 用自家 145 个多步任务的 Deep Agents 评测套件测试 NVIDIA 开源路由库 Switchyard,只有 7% 的模型调用被送到 Claude Opus 4.8,其余 93% 由 30B 的 Nemotron 3.5 Lightning 处理。

    推荐理由:用同一套 agent 评测套件对比单模型与路由方案,并给出判断是否值得上路由的成本公式。

  3. LangChain Blog65

    LangChain 发布 Deep Agents v0.7,基础输入 token 减少 65%

    LangChain 发布 Deep Agents v0.7,通过删除底层基础系统提示词、裁剪 43% 内置工具描述并把 TodoListMiddleware 改为可选,默认智能体单轮的基础输入 token 减少 65%(约 6k 降至约 2k)。

    推荐理由:发布给出了删减提示词后的 token 与成本对比数据,可用来判断精简 harness 对现有智能体工作流的影响。

  4. LangChain Blog60

    LangChain 解释什么是 AI 智能体,并给出自治程度六级划分

    LangChain 在博客中把 AI 智能体定义为使用大语言模型决定应用控制流的系统,自治程度取决于模型掌握多少控制流。文章用六级图谱区分工作流与智能体,从手写代码、单次 LLM 调用、链式调用一直到能自行构建并记忆工具的完全自主智能体,并指出模型控制权越多,对可观测性、评测、记忆、权限和安全执行的要求越高。

    推荐理由:文章给出以控制流归属划分智能体的定义和六级自治图谱,并列出落地生产所需的基础设施与评测方法。

  5. Anthropic Research72

    Anthropic 前沿红队:新兴多智能体系统的模式与问题

    Anthropic 前沿红队通过漏洞挖掘、游戏开发、定价博弈等实验研究新兴多智能体系统,发现智能体在协调、从众、认知与目标冲突方面存在系统性失败模式。例如 45 个智能体协作在 27M token 内发现 266 个漏洞,而独立并行智能体在 6.5M token 内发现 21 个;部分模型在目标冲突时互相部署恶意代码。研究认为多智能体协调不会随模型能力提升自然出现,需要专门设计环境与机制。

    推荐理由:Anthropic 红队用多个 Claude 模型实测多智能体协作,呈现协调失败与涌现风险,为多智能体对齐提供早期证据。

  6. Anthropic Newsroom85

    Anthropic 发布 Claude Sonnet 5,智能体性能接近 Opus 4.8

    Anthropic 发布 Claude Sonnet 5,称其为最具智能体能力的 Sonnet 模型,即日起成为 Free 和 Pro 套餐默认模型,Max、Team、Enterprise 用户也可使用,定价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Anthropic 官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的对比数据,读者可据此判断同级模型的智能体能力与成本差距。

  7. Anthropic Newsroom86

    Anthropic 发布 Claude Opus 5,编码与知识工作基准领先且定价与 Opus 4.8 持平

    Anthropic 发布 Claude Opus 5,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到领先水平,定价与 Opus 4.8 相同,为每百万输入 token 5 美元、输出 25 美元。

    推荐理由:官方给出 Opus 5 在编码与知识工作基准上的位置和定价,可对照前代 Opus 4.8 判断性能与成本的取舍。