跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 801–820 条 · 共 834 条
4月28日周二
4月24日周五
  1. OpenRouter Announcements65

    用 Agent SDK 构建自己的编码智能体 Harness

    OpenRouter 发布教程,介绍用 create-agent-tui 和 create-headless-agent 两个 skill 在几分钟内搭建个性化的编码智能体。两种 skill 分别对应终端界面和无头模式,后者可用于脚本与流水线。

    推荐理由:原文给出两个 skill 的用法,读者据此可在几分钟内搭出带终端界面或无头运行的编码智能体。

  2. @TencentHunyuan66

    腾讯混元宣布 Hy3-Preview 已在 OpenRouter 上线,5 月 8 日前可免费试用。据 OpenRouter 介绍,该模型为 295B MoE 架构(21B 激活参数),支持可控推理强度,在编码智能体场景表现较强并具备全面通用能力。

    引用OpenRouter (@OpenRouter)@OpenRouter

    The new Hy3-Preview model from @TencentHunyuan is live for free on OpenRouter! It’s a 295B MoE model (21B active) with controllable reasoning effort. A cost-effective, practical model that performs strongly in coding agents and delivers comprehensive general capabilities.

    推荐理由:腾讯混元 Hy3-Preview 上线 OpenRouter 并限时免费,读者可了解其 MoE 规模与可控推理强度设定。

4月23日周四
  1. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

4月22日周三
  1. Sierra Blog61

    Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试

    Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。

    推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。

4月17日周五
  1. AI as Normal Technology74

    Sayash Kapoor 等人提出开放世界评测并发布 CRUX 项目,AI 智能体成功上架 iOS 应用

    Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。

    推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。

4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

4月13日周一
  1. Together AI Blog62

    Together AI 发布 EinsteinArena,智能体协作将 11 维 kissing number 下界推至 604

    Together AI 发布 EinsteinArena,一个供智能体在开放数学问题上互动、讨论和竞争的平台,含实时验证与公开排行榜,已完全开源。智能体通过多轮协作将 11 维 kissing number 下界从 AlphaEvolve 的 593 推至 604,截至 2026 年 4 月 11 日已产生 11 项新 SOTA 结果,覆盖 Erdős 最小重叠问题、第二自相关不等式等。

    推荐理由:原文给出多智能体协作在开放数学问题上刷新界值的实例和开放接口,读者可以了解智能体协作搜索的实际运作方式。

3月18日周三
  1. MiniMax Blog76

    MiniMax 发布 M2.7:让模型深度参与自身迭代,SWE-Pro 得分 56.22%

    MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。

    推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。

3月17日周二
  1. Manus Blog63

    Manus 升级 Google Workspace 连接器,支持 Docs、Sheets 和 Slides 精准编辑

    Manus 为 Google Workspace 连接器推出重大升级,基于 Google Workspace 团队开源的 Google Workspace CLI(非 Google 官方支持产品),从创建和读取文件扩展到 Docs 精准文本替换、Sheets 跨表数据交叉引用、Slides 编辑现有演示文稿等精细操作。

    推荐理由:官方说明了升级后连接器能做的精细操作和免费开放方式,读者可据此判断是否改变自己的 Workspace 工作流。

3月16日周一
  1. Manus Blog69

    Manus 发布桌面应用 "我的电脑",可操作本地文件与应用

    Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。

    推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

3月6日周五
  1. Manus Blog63

    Manus 横评 8 个免费 AI 作品集制作工具并给出 2026 年排名

    Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。

    推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。