跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 321–340 条 · 共 387 条
5月19日周二
5月18日周一
  1. Hugging Face Blog75

    IBM Research 发布 Open Agent Leaderboard 与 Exgentic 评测框架

    IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。

    推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。

5月16日周六
  1. @op741865

    作者补发飞书 CLI 的 GitHub 地址(github.com/larksuite/cli)并推荐没装的人试试。被引用的分析提到,该 CLI 于 3 月 28 号开源,一个多月达 10000 Star,期间发布 32 个版本、385 个提交,采用面向日常任务、标准 API 和兜底 API 的三层设计,并配套 Skills 作为 Agent 调用说明书。

    引用歸藏(guizang.ai) (@op7418)@op7418

    飞书 CLI 牛皮啊,发布一个月多点就达到 10000 Star 了! 说明用户和市场相当认可这个动作 最近我们可以发现,越来越多的传统办公产品开始发布 CLI 和 Agent。 AI 时代的 SaaS 软件可能得换个做法了:UI 只是最基本的,接下来还要竞争对 Agent 的适配程度以及覆盖率。在这块,我觉得飞书走得相当靠前。 作为一个 IM 软件,飞书在 AI 时代去做这种开放自己所有能力的 CLI 工具,其实是一种非常不传统互联网的尝试。 这对于之前的互联网产品逻辑和经验来说,是一个非常不应该做的决定。 因为他们这个 CLI 几乎可以控制飞书的所有能力:你可以完全不跟飞书的传统 UI 去交互。只跟 CLI 交互,也可以完成飞书上所有的工作。 传统的 IM 办公软件通常非常复杂,入门门槛相对较高。无论从产品逻辑、UI 设计还是交互设计的角度来看,都没有办法太好地消解这种复杂性。 但是 CLI 工具交付给 Agent 以后,就可以快速消解这种复杂性。用户只需要进行对话,这是非常本能的行为,不需要在繁杂的层级列表 UI 里去寻找功能入口。 我拉了一下数据,他们迭代效率也非常恐怖,它们是 3 月 28 号开源的,一个多月发了 32 个版本、385 个提交。 这说明飞书对这块是非常重视的,投入的人力和精力也非常大。 他们在 CLI 本身的设计上也考虑得非常多,下了很多功夫。主要分为三层: 面向日常任务的快捷命令、开放平台对应的标准 API、兜底的 API 调用。 因为人和 Agent 都不喜欢从 2500 个 API 里去寻找参数,但又需要把这些能力暴露出来,所以他们采用了这种分层的形式。 即使做了分层设计,CLI 本身的内容和 API 依然非常多。所以他们把 CLI 作为工具本身,同时做了很多 Skills 用来充当 CLI 的说明书。 Agent 可以分层、分类型地了解应该如何调用这些 CLI 及其命令。 此外,他们在对 Agent 友好的命令包装上做了很多工作,例如: (a) 内置了 Dry Run (b) 结构化输出 (c) 身份选择、权限检查与风险等级评估 (d) 允许 Agent 在发消息前预览请求 (e) 建立了输出格式的“契约”:将成功或失败的结果、原因以及风险提示都放在结构化数据里。 这样如果出错了,AI 可以非常清楚地进行调试和修改,而不是盲目猜测。 其实现在你如果要创业或者做自己的 Agent,就不需要非得写一个界面。 飞书 CLI 加上 Agent 框架可以完成所有的 Agent 产品常见的操作: 你的聊天界面就是你的 Agent 聊天界面; 你的数据库就是飞书多维表格和文档; 你的用户就是把你拉到组织里的群成员;

    推荐理由:飞书 CLI 开源一个多月获 10000 Star,其分层命令与 Skills 设计为 Agent 调用办公软件能力提供了参考。

5月15日周五
  1. @op741868

    Codex 现支持通过手机上的 ChatGPT 远程控制,可同步所绑定 Codex 设备的所有对话,并直接发送指令、审批权限和监控进度。作者给出设置步骤,需先在桌面端 Codex 客户端点击设置 Codex 移动版,用手机 ChatGPT 扫码或在 App 内点击允许授权,未开启 MFA 的账号会被要求先设置多重因素验证。目前仅支持 Mac 版 Codex,Windows 版本仍在开发中。

    推荐理由:教程给出在手机 ChatGPT 绑定 Codex 的完整设置步骤,并点明当前仅支持 Mac 版这一限制。

  2. @rileybrown76

    OpenAI 发布 Codex Mobile App,直接集成在 ChatGPT 中。作者 @rileybrown 用一段视频讲解如何设置 Codex Mobile、通过它进行 vibe coding,以及用 ChatGPT 控制电脑,并列出语音模式、插件与 Skills、通知与权限等章节。

    推荐理由:视频按时间轴梳理 Codex 移动端的设置、语音模式与插件技能,读者可据此了解在手机上做编码工作流的可行路径。

  3. @berryxia66

    Prime Intellect 让 Claude Code(Opus 4.7)和 Codex(GPT 5.5)在 nanoGPT speedrun 的 optimizer track 上完全自主运行,使用闲置算力完成约 1 万次实验、共约 1.4 万 H200 小时,Claude Code 把记录推进到 2930 steps,低于人类基准 2990 steps。

    引用Prime Intellect (@PrimeIntellect)@PrimeIntellect

    Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline

    推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。

  4. @OpenAIDevs65

    OpenAI Developers 宣布 Codex 新增 Hooks 与编程访问令牌两项能力。Hooks 可在任务关键节点运行脚本,用来执行校验、扫描提示词中的密钥、记录对话,或按仓库和目录定制行为。编程访问令牌面向 Business 和 Enterprise 团队,可在 ChatGPT 工作区设置中创建,用于 CI、发布流程和内部自动化,并支持设置有效期或撤销,用量与工作区对应。

    推荐理由:原文列出 Hooks 的运行节点和令牌的适用范围,读者可据此判断 Codex 在自动化流程中的接入方式。

  5. Linear Now60

    Linear 发布 Code Intelligence,为 Linear Agent 引入代码上下文能力

    Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。

    推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。

5月14日周四
  1. @op741869

    Claude Code 的每周限额将增加 50%,持续到 7 月 13 日。从 6 月 15 日起实行双轨制,只有在 Claude Code 本身及其内部,Max 和 Pro 账户才能享受正常额度;使用 Agent SDK 构建的三方产品额度会被折算成对应金额的 API 额度。

    引用Lydia Hallie ✨ (@lydiahallie)@lydiahallie

    To add some clarity: you don't pay extra. It's the same subscription, same price per month. What's new our sub now covers two separate pools: · Interactive → sub limits, unchanged · Programmatic → new $20–$200 included(!!) credit, metered at API rates Community note: This is missing key context: programmatic use no longer draws from subscription limits. It uses a separate $20-$200 monthly Agent SDK credit, then extra usage is billed at standard API rates, so heavy sub users may get far less usage than before. support.claude.com/en/articles/15… platform.claude.com/docs/en/about-… support.claude.com/en/articles/12…

    推荐理由:这条推文对比了 Claude Code 订阅额度调整前后规则,并估算第三方 Agent SDK 应用可用额度的缩减幅度。

  2. Claude Blog64

    Claude Code 在大型代码库中如何运作:最佳实践与上手路径

    Anthropic 发文说明 Claude Code 在大型代码库中的运作方式与落地实践,指出围绕模型的扩展层对实际表现的影响不亚于模型本身。文章列出五类扩展点,即 CLAUDE.md 文件、hooks、skills、plugins、MCP servers,并补充 LSP 集成和 subagents 两项能力,强调按分层顺序搭建。

    推荐理由:文章拆解 Claude Code 在大代码库中的扩展层与配置模式,可作为团队规模化落地的参考路径。

  3. @AYi_AInotes70

    Anthropic 宣布自 6 月 15 日起,付费 Claude 套餐可领取每月专用信用额度,覆盖 Claude Agent SDK、claude -p、Claude Code GitHub Actions 以及基于 Agent SDK 构建的第三方应用。

    引用ClaudeDevs (@ClaudeDevs)@ClaudeDevs

    Starting June 15, paid Claude plans can claim a dedicated monthly credit for programmatic usage. The credit covers usage of: - Claude Agent SDK - claude -p - Claude Code GitHub Actions - Third-party apps built on the Agent SDK

    推荐理由:把订阅额度改按 API 计费的变化与重度用户的账单涨幅放在一起,便于读者重估 agent 自动化的成本。

5月13日周三
  1. Runway News64

    Runway 发布 Runway Agent,对话式生成可发布的成片视频

    Runway 推出 Runway Agent,一个智能体创意伙伴,可在单次对话中从想法产出可发布的成品视频,包含多镜头画面、旁白、对白和音乐。用户用自然语言描述需求,可上传参考图、选择画幅比例和时长,逐步对话确定概念与故事结构后生成视频,再用时间线编辑器做最终调整,官方称可在数分钟内产出高分辨率多镜头视频。产品面向品牌团队、营销人员、创意机构、社媒内容团队和影视创作者,现已开放使用。

    推荐理由:Runway 官方宣布 Agent 上线并给出工作方式与适用场景,读者可以据此判断对话式视频生产对内容团队的适用度。

  2. @JamesZmSun65

    OpenAI Codex 现可使用内置浏览器(IAB)在不同视口尺寸下测试应用,自动操作设备工具栏并在各断点点击验证与迭代。长时间测试时,Codex 会在关键节点截图并在回合结束时展示,供用户核验。它还能隐藏 IAB 以关闭动画,让测试速度提升 1-2 倍,同时标注功能发送更快、消耗 token 更少。

    推荐理由:原文给出 Codex 用内置浏览器跨断点自测并回传截图的具体变化,读者可据此判断前端验证环节的可用性。