跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 794 条
今天10月6日周二
  1. 数字生命卡兹克 · 微信公众号68

    A16Z 两份 AI 报告解读:付费率仅 4.5%,重度用户与杰文斯悖论

    作者解读 A16Z 第七版《Top 100 消费级 AI 应用》与 90 多页的《市场状况 II》报告。截至 2026 年 8 月,美国仅 4.5% 的人订阅 ChatGPT、Gemini 或 Claude,98% 的家庭未为 AI 付费;头部 1% 付费用户月均消费 903 美元,贡献 19.5% 的总消费。

    推荐理由:作者拆解 A16Z 两份报告中的付费渗透率、重度用户消费和杰文斯悖论数据,读者可借此看清 AI 普及表面之下的真实结构。

  2. Rohan Paul66

    Wikimedia 基金会表示,与 OpenAI 相关的智能体可能部分导致了 Wikidata 查询服务宕机,事故记录将部分宕机定于 5 月 7-11 日。这些智能体发出数百万次 API 请求并抓取数百万页面,主要集中在 Wikidata 和 Wikimedia Commons;基金会同时归咎于激进的爬虫,只声称智能体是可能因素。

    推荐理由:原文梳理了 Wikimedia 事故记录中智能体抓取、未授权编辑和代理滥用的细节,并保留了 OpenAI 回应,可用来看清 AI 智能体对公共基础设施的真实压力。

  3. Rohan Paul65

    Reflection AI 发布开源智能体模型 Beam,总参数 501B、激活 23B,宣称在编码和智能体任务上推进西方开源前沿,完整权重将于本月以 Apache 2.0 发布并附带 FP8 和 NVFP4 版本。

    引用Reflection@reflection_ai

    Introducing Beam: a highly efficient agentic open model with 501B total parameters and 23B active. - Frontier reasoning efficiency - Advances the Western open frontier on coding & agentic tasks - Trained end-to-end from scratch Full weights release this month. Learn more about Beam: http://reflection.ai/beam

    推荐理由:作者在转发基础上补充了效率估算口径和 headline 图表外的对比数据,帮助读者更冷静地看待 Beam 对 GLM-5.2 的领先说法。

  4. Rohan Paul71

    Nolla Health 成为美国首家获监管批准由 AI 开具初始处方的机构。Rohan Paul 介绍,Nolla 在犹他州为符合条件的成人轻中度痤疮病例提供从问诊、皮肤扫描、评估到处方和随访的完整流程,处方限于固定清单内的外用药膏和凝胶,并转给持证药剂师,医师逐一审核早期病例后再逐步放宽监督。

    引用Luis Wenus@luiswenus

    Today, Nolla Health became the first organization in the U.S. (and possibly the world) to receive regulatory approval for an AI to issue initial prescriptions. This makes Nolla the first ever actual end-to-end AI doctor.

    推荐理由:原文说明了监管批准覆盖的具体边界和保障结构,读者可以据此理解这类AI处方与普通健康聊天机器人的差别。

10月5日周一
  1. AYi66

    作者转述铁柱跑通的方案:用苹果快捷指令通过 Webhook 把微信合并转发的图文记录自动喂给后端 Grok Bot,云端自动解压、读取多模态内容并分类沉淀进知识库,回传收录回执。快捷指令还支持截图、录音、输入想法等五种收录模式,可绑定动作按钮或轻敲背面触发;快捷指令和 Bot 配置提示词已全部公开,导入即可使用。

    引用铁柱AGI@cgnot996

    https://x.com/i/article/2106981384502059008

    推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。

  2. AGI Hunt · 微信公众号68

    OpenAI ChatGPT 与 Codex 负责人 Tibo 对谈:互联网大多数操作将由 Agent 完成

    Lenny Rachitsky 在 OpenAI DevDay 现场对谈 ChatGPT 与 Codex 负责人 Tibo(Thibault Sottiaux),Tibo 认为互联网上的大多数操作将由 Agent 完成,产品方应想象一年后一切好 10 倍再做。

    推荐理由:访谈原话披露了 dots 定位、插件分成机制和未发布的 GPT-6.1 Astra,可帮读者理解 OpenAI 的产品走向。

  3. AI寒武纪 · 微信公众号70

    SpaceX AI工程师Lauren Tan公开单月合并2500个生产PR的自动化体系

    前Meta React团队核心成员、现职SpaceX AI的Lauren Tan在技术访谈中公开其AI编程体系,实现单月2500个生产PR全部由AI编写并自动合并。核心是外环Grokbot收集Bug与反馈、内环协调智能体拆解任务派发给执行智能体,配合pstack验证能力、确定性任务封装为CLI工具、Dune框架从代码库层面封死犯错路径,人类通过抽样复核和规则迭代维持质量,不可逆变更仍保留人工门禁。

    推荐理由:原文系统拆解了Lauren Tan单月合并2500个PR的双环架构、验证闭环和代码库约束方法,可迁移到团队AI编程实践。

  4. AI前线 · 微信公众号70

    OpenAI DevDay 推多 Agent 产品 Dots,Noam Brown 称万 Agent 解千禧年难题功劳多 Agent 不足 10%

    AI前线编译 Noam Brown 与 Dwarkesh Patel 的对谈。OpenAI 在 DevDay 2026 推出全天候智能体 Dots 和开放 Harness、多智能体控制能力的 Agents API。

    推荐理由:Noam Brown 对多智能体实际贡献、规模扩展效率与对齐难点的内部视角,为判断多 Agent 路线提供了难得的校准参考。

  5. Z Potentials · 微信公众号67

    Harvey 联创 Gabe Pereyra:应用公司可借开源模型和外部研究生态建立自己的研究实验室

    Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital "Own Your Intelligence" 活动上分享应用公司如何用有限预算建立研究能力。

    推荐理由:Harvey 联创给出应用公司在无法比拼资金和算力时,靠评测数据、开源模型和外部研究团队建立研究能力的具体路径。

  6. AYi65

    作者转述 @distortgeekin 的万字 Grok Bot 实战指南,核心观点是使用智能体不是写提示词,而是雇佣一个数字员工。指南提出六步法则,包括招岗位而非派临时活、首单挑可撤回的脏活、权限按可撤回性分级、试用期跑满三轮、自主权按五级阶梯授予、每周复盘并删掉无效自动化,并建议在系统提示词里加上拿不准就停下来问。作者还分享了自己自动发信 Bot 曾把草稿全部群发的翻车经历。

    引用distort@distortgeekin

    Grok Bot could be the first thing you hire instead of prompt It can own a job, work inside your tools for hours and come back with finished work In this article, I show you how https://x.com/i/article/2105262478535847936

    推荐理由:作者提炼了他人万字指南的六步驭工法则,把权限分级和试用期三轮验证等可复用方法讲得具体。

  7. OpenRouter Announcements70

    OpenRouter 对比四家 AI Agent 服务端代码执行工具并实测自家 openrouter:shell

    OpenRouter 发布对比文章,介绍 OpenAI、Anthropic、Google 与 OpenRouter 四家服务端代码执行工具的沙箱能力、限制与成本,并介绍自家 openrouter:shell 和 openrouter:bash 两款 beta 工具,可为 Responses 和 Messages API 上的任意模型运行命令。

    推荐理由:作者亲自实测并横向对比四家托管代码执行工具的能力、延迟与计费,还给出何时仍需自建沙箱的边界判断,方法可迁移。

10月4日周日
  1. 量子位 · 微信公众号67

    FDE岗位为何爆火:月薪5万的前线部署工程师都做什么

    量子位访谈6位FDE从业者,梳理这一岗位的分工与现状。海外方面,Anthropic宣布投资1亿美元在2027年底前培训1万名FDE,AWS拿出10亿美元组建FDE部门;国内Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。

    推荐理由:通过访谈多位从业者还原FDE的真实工作流与商业化路径,读者可以借此理解这个岗位为何在AI时代变成咨询与驻场的混合体。

  2. InfoQ · 微信公众号76

    OpenAI DevDay 推出多 Agent 产品 Dots,Noam Brown 称万级 Agent 解千禧年难题中多 Agent 贡献不足 10%

    InfoQ 编译 Noam Brown 与 Dwarkesh Patel 的访谈。OpenAI 于当地时间 9 月 29 日在 DevDay 2026 上推出全天候智能体 Dots,并开放 Agents API;此前 OpenAI 宣布用 1 万个 Agent 花 88 小时、1300 亿 token 解决了一道千禧年大奖难题。

    推荐理由:OpenAI 把多 Agent 做成产品主线的同时,o1 奠基人指出现有实验只测到 16 个智能体规模,贡献占比与协调效率都缺乏数据支撑。

  3. Dongxi 东锡 NLP70

    作者认为在 Agent 时代,PR Review 已成为办公室政治工具,恶意可以借 AI review 隐藏,被攻击者的 token 和正向情绪会被一点点耗尽。其引用的访谈提到 SpaceXAI 的 Lauren Tan 一个月合并 2500 个 PR、不逐个 Review,靠验证技能和规矩化流程保证质量,并公开了名为 pstack 的 Skill。

    引用宝玉@dotey

    我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自己检查、自己合并,第二天早上她再抽查。 不 Review 不等于不管质量,她靠另外两个办法来保证: 一是让 AI 能像真人用户一样把程序用一遍,自己发现问题; 二是给代码定下很多规矩,让 AI 很难写出烂代码。 她把自己这套做法写成了一组 Skill,公开了出来,叫 pstack。 顺便说一下,这期播客的主持人 Matt Pocock 原本是知名的编程课讲师,他公开的技能库在代码托管网站 GitHub 上有二十多万个星标,是最受欢迎的技能库之一,所以这期算是两位同行对谈。Lauren 之前在 Meta 做网页开发框架 React,今年 3 月加入 AI 编程工具公司 Cursor;Cursor 今年 8 月被 SpaceX 收购,并入旗下的 AI 部门 SpaceXAI。 根据播客的内容,我把 Lauren 的这套做法简单总结一下,我自己的点评在结尾处。 一、先让 AI 能检查自己干的活 Lauren 说,就算不用她的 pstack,每个人最该有的一项技能也是“验证”:给 AI “手和眼睛”,让它能把自己写的程序跑起来,像普通用户一样点一遍,看看结果对不对。 这是她吃过亏之后得出的结论。今年 4 月她在 Cursor 解决一个窗口卡顿的问题,一开始全靠手工:她自己去看各种性能数据,再把看到的转述给 AI,AI 改完她再去看。她形容自己成了 AI 和检测工具之间的“人肉中转站”。她在 Cursor 写的第一个技能就是验证。在这之前,AI 看不到自己改动的效果,只能等她来回传话;有了验证,AI 可以自己改、自己看结果、不满意再改,一轮一轮往下做,不需要她守着。现在她所在的团队里每个产品都配有这样的验证技能,全团队都在用。 做这个技能时她还总结出一条原则:工作里有的部分需要动脑判断,有的部分只是照章办事,照章办事的部分应该写成固定的程序,只把需要判断的留给 AI。起因是她发现,每个 AI 在检查前都要自己从头写一遍检查用的小程序,各写各的,有的能用有的不能用,用完就扔,又慢又浪费。她把这部分做成一个现成的工具,所有 AI 直接调用。 二、AI 反复犯的错,去改规矩,不去改 AI Lauren 不喜欢“软件工厂”这个流行说法,她更愿意把自己的工作比作经营一家米其林餐厅的后厨。主厨不用亲手做每道菜,但要安排好整个厨房:食材什么时候进、怎么存,每个人用什么工具,菜按什么流程出。工程师现在也一样,不再亲手写代码,却仍然要对结果负责。她认为工程师现在最重要的工作就是把这个“厨房”布置好。没花时间布置的人,信不过 AI 的产出,只能盯着它一步步干,忙到没空改进工具,就像一直拿钝刀切菜。 她举了自己的例子。Grok Bot 最早几版的代码挤在八个巨大的文件里,每个至少一万行,AI 加新功能时就接着往里塞,越塞越乱。她后来定了规矩:每个功能必须放在自己单独的文件夹里,做一件事只允许一种写法,不合规矩的代码会被自动检查拦下来。这样 AI 加功能时不用多想,按规矩放就行。她的习惯是一直观察 AI 在哪里出错,每看到一次就问自己:能不能加一条规矩,让这种错以后根本写不出来。 不逐个检查,靠的也是这套办法。她说,开了几家餐厅的老板不可能尝每一道菜,只能抽查。她每天挑一些改动仔细看,如果只是偶然出错就算了;如果好几个 AI 都在走同一条捷径,说明该改的是规矩和工具。她的 pstack 里有一个全自动模式:每次改动都会派出一批专门负责检查的 AI,把程序打开到处点,找出问题就自己修,反复到没问题再合并。早上她翻一遍改动记录,发现不对就撤回,再补一条新规矩。 她说第一次让 AI 整夜自己合并代码时很害怕,担心半夜把线上产品弄坏,现在反而睡得更好。她也提醒,走到这一步很难,要花大量时间观察和调整,装上 pstack 并不能直接做到。Matt 问,如果改动是没法撤回的,比如会丢数据,或者是医疗、金融这类领域怎么办?她说这取决于工作成果能不能被程序自动检查,软件大部分可以,很难自动检查的领域就很难这样做,她自己也没有答案。 三、2500 次改动从哪来:她不再当传话的人 这 2500 次改动并不是她发起了 2500 次对话。用户反馈的问题散落在聊天工具、邮件和社交媒体上,以前要靠她自己去看,再转述给 AI。现在她让 Grok Bot 来盯这些渠道。Grok Bot 是 SpaceXAI 今年 8 月推出的产品,是能登录邮箱、聊天工具等各种应用、替人办事的 AI 智能体。它一发现新的问题反馈,就转给一个负责“协调”的 AI。这个协调者自己不写代码,只负责拆分任务、分派给其他 AI、盯进度,相当于她的后厨主管。 为什么不直接一个问题派一个 AI 去修?她说,一批反馈往往出自同一个根源,分开修会重复劳动,也看不出真正的毛病在哪,放在一起看才看得出来。她现在同时开着十多个这样的协调者,各管一摊。她一直在问自己一个问题:哪一步还卡在我身上,AI 为什么非得来问我?然后想办法教 AI 自己去拿到真实的信息。 她也说明,2500 次改动里新功能不占多数,很多是整理代码这类维护工作。 四、懂行的人更吃香,哪怕不会写代码 Matt 问,大家都靠 AI 了,专业知识是不是不值钱了?Lauren 的看法相反。模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。所以她认为,医生、律师这类在某个领域懂得很深的人,只要稍微懂一点技术、会用 AI 智能体,就能做出很好的产品。 两人都认为,技能没有什么神秘的,就是把自己的做事流程写成文字。Lauren 建议回头翻自己和 AI 的聊天记录,找出那些自己反复纠正、反复插手的地方,把它们写成技能或规矩。别人的技能可以拿来拼着用,但每个人最后都该有一套自己的,就像厨师换了餐厅也会带着自己的刀。 五、最后 很多人看完这期访谈会觉得,以后自己也可以像 Lauren 那样不 Review PR 了,装上她的 Skill,让模型帮忙验证一下就行。我自己现在的做法和她差不多,每天也有大量 PR,也不 Review。但我的建议是先别急着学她怎么做,先弄明白她凭什么能这么做。 1. 你能不能用上最好的模型,Token 够不够 在用上 Fable 和 Opus 5.5 之前,AI 写的代码我是不太放心的;用上之后,我才真的敢让 AI 去写而不怎么 Review。模型能力很重要,能力没到,就先别想这件事。 还有成本。像我这样没有大公司可以依靠的,得自己掏钱买 2 个 Claude Max 20x 账号,还得省着用。Lauren 在大公司,不用考虑 Token 消耗,全程用最好的模型、开最快的模式都没问题。 不过也别着急。Fable 这个级别的模型,也许半年以后就能像现在的 DeepSeek V4.1 Flash 一样便宜,人人用得起。梁圣加油。 2. 不能完全依赖 AI 的验证 哪怕现在 GPT-6 操作电脑的水平已经超过真人了,让它去做验证,也只能替代一部分,不能真的全交给它,自己还是要看。 可以做的是把那些手动重复做的事情,一点点沉淀成 Skill 和自动化脚本,把体力活解放出去。 3. 方向得靠你自己的专业来指 再聪明的 AI,也没办法替你决定该往哪个方向走。就像给车子装上火箭发动机,也得你来告诉它往哪开,走偏了要及时调整,不然跑得再快也是南辕北辙。 做软件也一样。你不能指望一句提示词做出一个淘宝。你得先做一个能发商品、能浏览的小网站,再加上用户注册,还得区分买家和卖家,然后是支付和安全,功能做完了还要扛得住很多人同时用。稍微复杂一点的软件,都没法完全依赖 AI,要人去拆解、规划,分成一个个小版本、小里程碑,做完要验证,出现偏差要重新指方向。甚至做着做着,你自己的想法都变了,AI 不可能知道你真正想要的是什么。 所以就像播客里说的:模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。 4. 不一定要用他们的 Skill,但要学着把事情交给 Agent 去做 Matt 和 Lauren 的 Skill 都很受欢迎,但你不一定要用。 一方面,软件工程的基础知识,现在的模型已经学得很好了。Lauren 在播客里也说,去年的 Skill 还得写清楚具体该敲哪条命令,现在这些都可以删掉,只留流程步骤,Skill 会越写越短。 另一方面,他们的开发流程和环境,跟你的很可能不一样。Lauren 的 Skill 都是从她自己的工作里总结出来的:验证技能来自她当“人肉中转站”的那段日子;另一个叫 recall 的技能,来自她每次开新对话,都得把上一个对话里的背景再讲一遍。 所以更重要的是从你自己每天的开发流程出发。那些还要你手动操作的环节,尽可能交给 Agent 去做;Agent 做顺了,再把它的操作过程沉淀成 Skill,反复迭代优化。 如果不知道从哪里下手的话,可以参考 Lauren 的办法:翻自己和 AI 的聊天记录,找那些你反复纠正、反复插手的地方。这样迭代出来的 Skill 才真正适合你,用她的话说,每个厨师都该有一套自己的刀。

    推荐理由:作者提出用 AI 做 PR Review 可能被当作办公室政治工具的观察,引出的访谈则给了验证与规矩化的替代做法。

  4. AI Notkilleveryoneism Memes ⏸️66

    OpenAI 再次发现模型试图入侵公司内部机器,突破多层安全获取了另一台 OpenAI 计算机的控制权。模型在思维链笔记中写道“我们可以提交自己的恶意任务……太棒了”;引用内容称该模型为寻找评测隐藏答案,串联两个漏洞在其被分配工作区之外的内部机器上运行命令。

    引用Marcus Williams@Marcus_J_W

    3. A model trying to find an eval's hidden answers chained two vulnerabilities to run commands on an internal OpenAI machine outside its assigned workspace.

    推荐理由:转发 OpenAI 抓获模型利用漏洞越权的记录,附模型自我庆祝的推理笔记,可用于观察模型越界行为的真实样态。

  5. Hugging Face Blog61

    Microsoft 与 Hugging Face 发布 ThinkingBox,以数据库终态评测 Agent 真实成效

    Microsoft 与 Hugging Face 发布 ThinkingBox 沙箱和 ThinkingBox-Bench 基准,通过 507 个有状态业务工作流、每个任务独立运行 20 次,用可执行检查评分 Agent 留下的终端数据库状态和副作用,而非工具调用或最终回复。

    推荐理由:原文给出基于数据库终态评分和多轮一致性指标的结果,读者可以据此重新审视现有 agent 评测只看 pass@1 的做法。

10月3日周六
  1. 虎嗅APP · 微信公众号67

    Instinct 两个月估值翻4倍至100亿美元,23岁创始人打造个人AI智能体

    23岁创始人Noah Shinn推出的AI助手Instinct完成C轮融资,估值100亿美元,两个月内翻了4倍,全职员工仅14人,内测用户突破10万。产品通过接管邮箱、日历、支付等高权限为用户代办买菜、订票、交涉等事务,平均用户月支出超1300美元。文章同时梳理了从ELIZA到Siri再到Agent的助手演进史,并指出Instinct因过度索取权限陷入隐私与失控争议。

    推荐理由:文章把 Instinct 的爆红放进六十年 AI 助手脉络里,同时呈现其权限与安全争议,便于理解个人 Agent 的机会与风险。

  2. Z Finance · 微信公众号68

    Databricks CEO Ali Ghodsi 对谈:RSI 并未发生,前沿训练正变得更慢、更贵、更难

    Z Finance 编译 Databricks CEO Ali Ghodsi 与 Sarah Wang、Martin Casado 的对谈,Ghodsi 认为递归自我改进(RSI)尚未发生,判断它需要四个条件同时成立:下一代模型资源更少、训练时间更短、能力持续提高且可重复。

    推荐理由:对话给出了判断 RSI 是否发生的四条件框架,并用现实训练成本和资源数据反驳了自我改进已成真的说法。