Claude Managed Agents 推出 dreaming、outcomes 与多智能体编排
Anthropic 在 Claude Managed Agents 中推出 dreaming 研究预览,并开放 outcomes、多智能体编排和 webhooks。
推荐理由:官方公布了 dreaming、outcomes 与多智能体编排的具体机制和内部基准数据,可了解 Managed Agents 的能力边界与实际收益。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Anthropic 在 Claude Managed Agents 中推出 dreaming 研究预览,并开放 outcomes、多智能体编排和 webhooks。
推荐理由:官方公布了 dreaming、outcomes 与多智能体编排的具体机制和内部基准数据,可了解 Managed Agents 的能力边界与实际收益。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
IBM Research 发布 Open Agent Leaderboard,把完整智能体系统而非单个模型作为评测单位,同时报告成功率和每任务成本,并开源配套的 Exgentic 评测框架与论文。
推荐理由:榜单把完整智能体系统而非单个模型作为评测单位,同时给出质量与成本,便于判断不同实现的部署取舍。
Anthropic 发布内部手册《Founder's Playbook》,基于 Claude Code 和一批 YC 创始人的踩坑经验,提出 AI 会让创业失败率上升而非下降。
x.com/i/article/205523912843…
推荐理由:Anthropic 把 Claude Code 在创业各阶段的踩坑经验拆成四个阶段,读者可对照自查原型验证与技术债。
Google DeepMind 发布 Gemini 3.5 模型系列,首个模型 3.5 Flash 当天全球可用,定位为面向智能体工作流与编码的旗舰级速度模型。
推荐理由:官方公布了 3.5 Flash 的基准成绩、发布渠道和 3.5 Pro 时间表,读者可以据此评估其智能体与编码能力变化。
飞书 CLI 牛皮啊,发布一个月多点就达到 10000 Star 了! 说明用户和市场相当认可这个动作 最近我们可以发现,越来越多的传统办公产品开始发布 CLI 和 Agent。 AI 时代的 SaaS 软件可能得换个做法了:UI 只是最基本的,接下来还要竞争对 Agent 的适配程度以及覆盖率。在这块,我觉得飞书走得相当靠前。 作为一个 IM 软件,飞书在 AI 时代去做这种开放自己所有能力的 CLI 工具,其实是一种非常不传统互联网的尝试。 这对于之前的互联网产品逻辑和经验来说,是一个非常不应该做的决定。 因为他们这个 CLI 几乎可以控制飞书的所有能力:你可以完全不跟飞书的传统 UI 去交互。只跟 CLI 交互,也可以完成飞书上所有的工作。 传统的 IM 办公软件通常非常复杂,入门门槛相对较高。无论从产品逻辑、UI 设计还是交互设计的角度来看,都没有办法太好地消解这种复杂性。 但是 CLI 工具交付给 Agent 以后,就可以快速消解这种复杂性。用户只需要进行对话,这是非常本能的行为,不需要在繁杂的层级列表 UI 里去寻找功能入口。 我拉了一下数据,他们迭代效率也非常恐怖,它们是 3 月 28 号开源的,一个多月发了 32 个版本、385 个提交。 这说明飞书对这块是非常重视的,投入的人力和精力也非常大。 他们在 CLI 本身的设计上也考虑得非常多,下了很多功夫。主要分为三层: 面向日常任务的快捷命令、开放平台对应的标准 API、兜底的 API 调用。 因为人和 Agent 都不喜欢从 2500 个 API 里去寻找参数,但又需要把这些能力暴露出来,所以他们采用了这种分层的形式。 即使做了分层设计,CLI 本身的内容和 API 依然非常多。所以他们把 CLI 作为工具本身,同时做了很多 Skills 用来充当 CLI 的说明书。 Agent 可以分层、分类型地了解应该如何调用这些 CLI 及其命令。 此外,他们在对 Agent 友好的命令包装上做了很多工作,例如: (a) 内置了 Dry Run (b) 结构化输出 (c) 身份选择、权限检查与风险等级评估 (d) 允许 Agent 在发消息前预览请求 (e) 建立了输出格式的“契约”:将成功或失败的结果、原因以及风险提示都放在结构化数据里。 这样如果出错了,AI 可以非常清楚地进行调试和修改,而不是盲目猜测。 其实现在你如果要创业或者做自己的 Agent,就不需要非得写一个界面。 飞书 CLI 加上 Agent 框架可以完成所有的 Agent 产品常见的操作: 你的聊天界面就是你的 Agent 聊天界面; 你的数据库就是飞书多维表格和文档; 你的用户就是把你拉到组织里的群成员;
推荐理由:飞书 CLI 开源一个多月获 10000 Star,其分层命令与 Skills 设计为 Agent 调用办公软件能力提供了参考。




推荐理由:教程给出在手机 ChatGPT 绑定 Codex 的完整设置步骤,并点明当前仅支持 Mac 版这一限制。
推荐理由:视频按时间轴梳理 Codex 移动端的设置、语音模式与插件技能,读者可据此了解在手机上做编码工作流的可行路径。
Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline
推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。
推荐理由:原文列出 Hooks 的运行节点和令牌的适用范围,读者可据此判断 Codex 在自动化流程中的接入方式。
OpenAI 今天在 iOS 和 Android 全支持地区以预览形式推出 Codex。后续将支持把手机连接到 Windows 上的 Codex 应用。
推荐理由:OpenAI 把 Codex 推到 iOS 和 Android 预览,读者可据此了解手机端接入编码智能体的现有范围。
Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。
推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。
OpenAI 在 ChatGPT 移动端上线 Codex,用户可跨设备、在远程环境中实时监控、引导并审批编码任务。
推荐理由:Codex 接入 ChatGPT 移动端,读者可了解跨设备监控与审批编码任务的使用方式。
OpenAI 公布为 Codex 构建 Windows 沙箱的实现思路,目的是让编码智能体保持可用,不必在频繁审批弹窗与整机访问权限之间二选一。官方在文中附上了说明页面链接。
推荐理由:官方拆解 Codex Windows 沙箱的实现,为编码智能体在权限审批与整机访问之间提供一种工程折中思路。


To add some clarity: you don't pay extra. It's the same subscription, same price per month. What's new our sub now covers two separate pools: · Interactive → sub limits, unchanged · Programmatic → new $20–$200 included(!!) credit, metered at API rates Community note: This is missing key context: programmatic use no longer draws from subscription limits. It uses a separate $20-$200 monthly Agent SDK credit, then extra usage is billed at standard API rates, so heavy sub users may get far less usage than before. support.claude.com/en/articles/15… platform.claude.com/docs/en/about-… support.claude.com/en/articles/12…
推荐理由:这条推文对比了 Claude Code 订阅额度调整前后规则,并估算第三方 Agent SDK 应用可用额度的缩减幅度。
Anthropic 发文说明 Claude Code 在大型代码库中的运作方式与落地实践,指出围绕模型的扩展层对实际表现的影响不亚于模型本身。文章列出五类扩展点,即 CLAUDE.md 文件、hooks、skills、plugins、MCP servers,并补充 LSP 集成和 subagents 两项能力,强调按分层顺序搭建。
推荐理由:文章拆解 Claude Code 在大代码库中的扩展层与配置模式,可作为团队规模化落地的参考路径。
阿易 AI Notes 补充了 Claude 新定价 $200/$100 背景下给实际运行 agent 用户的五条具体建议。
推荐理由:按用户类型给出算 token 消耗、席位选择与第三方工具的具体应对,可迁移到其他按量计费的 agent 场景。
Starting June 15, paid Claude plans can claim a dedicated monthly credit for programmatic usage. The credit covers usage of: - Claude Agent SDK - claude -p - Claude Code GitHub Actions - Third-party apps built on the Agent SDK
推荐理由:把订阅额度改按 API 计费的变化与重度用户的账单涨幅放在一起,便于读者重估 agent 自动化的成本。
Runway 推出 Runway Agent,一个智能体创意伙伴,可在单次对话中从想法产出可发布的成品视频,包含多镜头画面、旁白、对白和音乐。用户用自然语言描述需求,可上传参考图、选择画幅比例和时长,逐步对话确定概念与故事结构后生成视频,再用时间线编辑器做最终调整,官方称可在数分钟内产出高分辨率多镜头视频。产品面向品牌团队、营销人员、创意机构、社媒内容团队和影视创作者,现已开放使用。
推荐理由:Runway 官方宣布 Agent 上线并给出工作方式与适用场景,读者可以据此判断对话式视频生产对内容团队的适用度。
推荐理由:原文给出 Codex 用内置浏览器跨断点自测并回传截图的具体变化,读者可据此判断前端验证环节的可用性。