跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 561–580 条 · 共 586 条
4月28日周二
  1. inclusionAI Hugging Face models62

    inclusionAI 发布 DR-Venus-4B-SFT 深度研究智能体模型

    inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。

    推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。

  2. Claude Blog65

    华盛顿大学 MacCoss 实验室用新开发者入职法让 Claude Code 接管 70 万行遗留代码

    华盛顿大学 MacCoss 实验室的 Brendan MacLean 将17年培养新开发者的入职方法应用于 Claude Code,把 AI 上下文放入独立仓库 pwiz-ai,用 CLAUDE.md、技能库和 MCP 集成管理 70 万行 C# 的 Skyline 代码库。

    推荐理由:原文给出维护17年、70万行C#代码库的上下文分层和技能库方法,对长期项目接入 Claude Code 有可迁移的参考。

4月24日周五
  1. OpenRouter Announcements65

    用 Agent SDK 构建自己的编码智能体 Harness

    OpenRouter 发布教程,介绍用 create-agent-tui 和 create-headless-agent 两个 skill 在几分钟内搭建个性化的编码智能体。两种 skill 分别对应终端界面和无头模式,后者可用于脚本与流水线。

    推荐理由:原文给出两个 skill 的用法,读者据此可在几分钟内搭出带终端界面或无头运行的编码智能体。

  2. @TencentHunyuan66

    腾讯混元宣布 Hy3-Preview 已在 OpenRouter 上线,5 月 8 日前可免费试用。据 OpenRouter 介绍,该模型为 295B MoE 架构(21B 激活参数),支持可控推理强度,在编码智能体场景表现较强并具备全面通用能力。

    引用OpenRouter (@OpenRouter)@OpenRouter

    The new Hy3-Preview model from @TencentHunyuan is live for free on OpenRouter! It’s a 295B MoE model (21B active) with controllable reasoning effort. A cost-effective, practical model that performs strongly in coding agents and delivers comprehensive general capabilities.

    推荐理由:腾讯混元 Hy3-Preview 上线 OpenRouter 并限时免费,读者可了解其 MoE 规模与可控推理强度设定。

4月23日周四
  1. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

4月22日周三
  1. Sierra Blog61

    Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试

    Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。

    推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。

  2. OpenAI News72

    OpenAI 在 ChatGPT 中推出工作区智能体

    OpenAI 在 ChatGPT 中推出工作区智能体,这类智能体由 Codex 驱动,可自动化复杂工作流。它们运行在云端,帮助团队跨工具安全地扩展工作。

    推荐理由:官方说明了工作区智能体由 Codex 驱动并在云端运行,读者可据此判断它与现有团队工作流的衔接方式。

4月17日周五
  1. AI as Normal Technology74

    Sayash Kapoor 等人提出开放世界评测并发布 CRUX 项目,AI 智能体成功上架 iOS 应用

    Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。

    推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。

4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

1月28日周三
  1. Mistral AI70

    Mistral 发布 Mistral Vibe 2.0 终端编码智能体并调整 Devstral 2 定价

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。

    推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。