跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 721–740 条 · 共 798 条
5月20日周三
  1. @AYi_AInotes70

    Google 在 I/O 上发布 Gemini 3.5 Flash,称其智能与顶级模型相当但输出速度是其他前沿模型的 4 倍,并当天面向所有人开放。作者认为配套的 Antigravity 平台提供桌面端、CLI 和 SDK 全栈开放,目标是做 Agent 时代的 AWS,而 Spark 个人 Agent 只是示范。

    引用Sundar Pichai (@sundarpichai)@sundarpichai

    Just off stage at #GoogleIO, some highlights from this morning 🧵 Gemini 3.5 Flash is available today for everyone in @antigravity and across our products and APIs. Compared to 3.1 Pro, 3.5 Flash is better across almost all benchmarks with huge progress in coding. It’s also comparable to the best models but very fast (4x faster tokens/ second than other frontier models). And when looking at the intelligence versus output speed, it’s in a league of its own in the top right quadrant.

    推荐理由:把胜负手从模型智力转向智能乘速度乘可部署性,作者给出 Google Agent 基础设施的另一种解读。

  2. @antigravity70

    Antigravity 2.0 发布,是一款全新的独立桌面应用,主打面向智能体的完整体验。官方称其从底层重建,具备多智能体团队、定时任务、原生语音,以及与其他 Google 产品的一键集成能力,并附上了上手说明。

    推荐理由:Antigravity 2.0 把多智能体团队、定时任务和原生语音整合进独立桌面应用,并支持一键接入 Google 其他产品。

  3. @Google66

    Google 在 Google I/O 上发布 Gemini Spark,一款可在用户指示下代为执行操作的 24/7 个人 AI 智能体。该智能体运行在 Gemini 3.5 上、基于 Antigravity 构建,可轻松在后台执行长时间运行的任务。由于运行在 Google Cloud 的专用虚拟机上,用户无需保持笔记本电脑开启;它将与 Google 工具无缝集成,并很快通过 MCP 接入第三方。

    推荐理由:官方给出了这款常驻智能体的运行方式与接入路径,读者可据此判断云端后台执行型智能体的落地形态。

5月19日周二
  1. @op741865

    英伟达开始交付自研通用 CPU NVIDIA Vera,主要面向长期高并发高吞吐场景,用于 Agent 编排和工具调用的中枢。作者指出模型在 GPU 上推理,而调度编排和调用工具放在该 CPU 上,密集 Agent 常驻带来的强 IO、内存和调度压力由 CPU 承担。此次交付由英伟达上门送至 Anthropic、OpenAI、xAI、OCI,其中 xAI 由马斯克接待。

    引用NVIDIA (@nvidia)@nvidia

    NVIDIA’s Ian Buck hand-delivered the first-ever NVIDIA Vera CPUs to our partners @AnthropicAI, @OpenAI, @SpaceX, and @OracleCloud. 🎉 Vera is NVIDIA's first custom CPU, purpose-built for the age of agentic AI. This is just the beginning. The road to Vera-powered systems starts here. Thank you to our partners for being on this journey with us. The best is yet to come. 💚 Video

    推荐理由:英伟达把自研 CPU Vera 定位为 Agent 编排与工具调用的中枢,交付对象透露出这类常驻负载的硬件思路。

  2. @op741865

    Telegram 上的机器人现在可以直接与其他机器人对话,群聊里可以拉入多个不同的 Agent 机器人进行交流。作者转发的 @durov 公告称,这是应 AI 开发者的需求推出,智能体由此获得了人类可以跟随的通信层。

    引用Pavel Durov (@durov)@durov

    🤖 AI devs asked for this — and we delivered. 💬 Bots can now talk to other bots on Telegram. 🧠 Autonomous agents now have a communication layer humans can follow.

    推荐理由:Telegram 开放机器人互相对话能力,群聊可拉入多个 Agent 机器人,读者可据此判断多智能体协作在社交场景的落地形态。

  3. @berryxia66

    Odyssey 发布 Agora-1,一个多智能体世界模型,人类与 AI 可同时进入同一模拟世界并实时互动、互相影响。官方推出可游玩的研究预览,用 Agora-1 模拟多人 GoldenEye 死亡竞赛,模型实时生成画面和声音,整个世界持续更新。

    引用Odyssey (@odysseyml)@odysseyml

    Introducing Agora-1, a multi-agent world model. Multiple participants—human or AI—can now interact inside the same world simulation, all in real-time. Try our playable research preview today, with Agora-1 simulating a multiplayer GoldenEye deathmatch! Video

    推荐理由:世界模型从单人视频生成扩展到多人实时共享模拟,读者可据此了解人机共处同一模拟世界的当前形态。

5月18日周一
  1. Hugging Face Blog75

    IBM Research 发布 Open Agent Leaderboard 与 Exgentic 评测框架

    IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。

    推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。

5月16日周六
  1. @op741865

    作者补发飞书 CLI 的 GitHub 地址(github.com/larksuite/cli)并推荐没装的人试试。被引用的分析提到,该 CLI 于 3 月 28 号开源,一个多月达 10000 Star,期间发布 32 个版本、385 个提交,采用面向日常任务、标准 API 和兜底 API 的三层设计,并配套 Skills 作为 Agent 调用说明书。

    引用歸藏(guizang.ai) (@op7418)@op7418

    飞书 CLI 牛皮啊,发布一个月多点就达到 10000 Star 了! 说明用户和市场相当认可这个动作 最近我们可以发现,越来越多的传统办公产品开始发布 CLI 和 Agent。 AI 时代的 SaaS 软件可能得换个做法了:UI 只是最基本的,接下来还要竞争对 Agent 的适配程度以及覆盖率。在这块,我觉得飞书走得相当靠前。 作为一个 IM 软件,飞书在 AI 时代去做这种开放自己所有能力的 CLI 工具,其实是一种非常不传统互联网的尝试。 这对于之前的互联网产品逻辑和经验来说,是一个非常不应该做的决定。 因为他们这个 CLI 几乎可以控制飞书的所有能力:你可以完全不跟飞书的传统 UI 去交互。只跟 CLI 交互,也可以完成飞书上所有的工作。 传统的 IM 办公软件通常非常复杂,入门门槛相对较高。无论从产品逻辑、UI 设计还是交互设计的角度来看,都没有办法太好地消解这种复杂性。 但是 CLI 工具交付给 Agent 以后,就可以快速消解这种复杂性。用户只需要进行对话,这是非常本能的行为,不需要在繁杂的层级列表 UI 里去寻找功能入口。 我拉了一下数据,他们迭代效率也非常恐怖,它们是 3 月 28 号开源的,一个多月发了 32 个版本、385 个提交。 这说明飞书对这块是非常重视的,投入的人力和精力也非常大。 他们在 CLI 本身的设计上也考虑得非常多,下了很多功夫。主要分为三层: 面向日常任务的快捷命令、开放平台对应的标准 API、兜底的 API 调用。 因为人和 Agent 都不喜欢从 2500 个 API 里去寻找参数,但又需要把这些能力暴露出来,所以他们采用了这种分层的形式。 即使做了分层设计,CLI 本身的内容和 API 依然非常多。所以他们把 CLI 作为工具本身,同时做了很多 Skills 用来充当 CLI 的说明书。 Agent 可以分层、分类型地了解应该如何调用这些 CLI 及其命令。 此外,他们在对 Agent 友好的命令包装上做了很多工作,例如: (a) 内置了 Dry Run (b) 结构化输出 (c) 身份选择、权限检查与风险等级评估 (d) 允许 Agent 在发消息前预览请求 (e) 建立了输出格式的“契约”:将成功或失败的结果、原因以及风险提示都放在结构化数据里。 这样如果出错了,AI 可以非常清楚地进行调试和修改,而不是盲目猜测。 其实现在你如果要创业或者做自己的 Agent,就不需要非得写一个界面。 飞书 CLI 加上 Agent 框架可以完成所有的 Agent 产品常见的操作: 你的聊天界面就是你的 Agent 聊天界面; 你的数据库就是飞书多维表格和文档; 你的用户就是把你拉到组织里的群成员;

    推荐理由:飞书 CLI 开源一个多月获 10000 Star,其分层命令与 Skills 设计为 Agent 调用办公软件能力提供了参考。

5月15日周五
  1. @op741868

    Codex 现支持通过手机上的 ChatGPT 远程控制,可同步所绑定 Codex 设备的所有对话,并直接发送指令、审批权限和监控进度。作者给出设置步骤,需先在桌面端 Codex 客户端点击设置 Codex 移动版,用手机 ChatGPT 扫码或在 App 内点击允许授权,未开启 MFA 的账号会被要求先设置多重因素验证。目前仅支持 Mac 版 Codex,Windows 版本仍在开发中。

    推荐理由:教程给出在手机 ChatGPT 绑定 Codex 的完整设置步骤,并点明当前仅支持 Mac 版这一限制。

  2. @rileybrown76

    OpenAI 发布 Codex Mobile App,直接集成在 ChatGPT 中。作者 @rileybrown 用一段视频讲解如何设置 Codex Mobile、通过它进行 vibe coding,以及用 ChatGPT 控制电脑,并列出语音模式、插件与 Skills、通知与权限等章节。

    推荐理由:视频按时间轴梳理 Codex 移动端的设置、语音模式与插件技能,读者可据此了解在手机上做编码工作流的可行路径。

  3. @berryxia66

    Prime Intellect 让 Claude Code(Opus 4.7)和 Codex(GPT 5.5)在 nanoGPT speedrun 的 optimizer track 上完全自主运行,使用闲置算力完成约 1 万次实验、共约 1.4 万 H200 小时,Claude Code 把记录推进到 2930 steps,低于人类基准 2990 steps。

    引用Prime Intellect (@PrimeIntellect)@PrimeIntellect

    Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline

    推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。