跳到正文

#Agent

今日 86 条
9月21日周一
  1. Baidu Inc.33

    原 Oreate AI 正式更名为 Kooko,这款一体化 AI 工作空间上线首年即在近 200 个国家和地区积累超 1000 万国际用户。Kooko 可基于用户授权的文件与来源做研究、数据分析和内容创作,把简报转化为文档、演示文稿和表格,并在内置 Office 编辑器中修改。它还支持记忆功能,保存编辑、偏好和已完成工作作为后续任务的上下文,并提供桌面端和移动端应用。

  2. OpenRouter Announcements68

    TypeSafe 决策模型 Jev 1.13 上线 OpenRouter,面向开发者解析用法

    TypeSafe 于 2026 年 9 月 15 日发布早期访问版决策模型 Jev(当前版本 1.13),现已可通过 OpenRouter 调用。Jev 是非生成式决策模型,只接受文本输入,返回 Choice、Score、Noul 三种类型化答案并附带校准概率,无自由文本输出。

    推荐理由:原文给出 Jev 三个返回原语、真实 API 响应和定价细节,开发者可据此判断是否用它替换现有 LLM 加正则的分类流程。

9月20日周日
9月19日周六
  1. elsewhere articles65

    YC 2026 夏季批次 236 家公司分析:Agent 退潮,创业重心向算力、芯片和实体世界下沉

    十字路口编译 Chris Lu 对 YC 2026 夏季批次 236 家公司、470 位创始人的分析。91% 的公司与 AI 相关,但模型以下的公司占比从春季批次的 8% 升至 20%,应用层从 55% 降至 39%;自主 Agent 公司占比从 45% 降至 33%。

    推荐理由:原文用同一套技术栈框架对比 YC 春夏两批公司数据,给出了 Agent 退潮、创业重心下沉到底层和实体世界的量化变化。

  2. Andrew Milich29

    用 @bot 省钱!

    引用Evan Bacon@Baconbrix

    GROK BOT JUST FOUND $986 IN MY EMAIL 🤯 I asked Grok to get a parking spot for the car it bought me, and on the way it discovered nearly a thousand dollars of extraneous charges from my apartment and emailed them asking for a refund.

9月18日周五
  1. AI at Meta63

    Meta 宣布 Muse for Mac 今日起推送,用户可在电脑上让这一个人智能体直接执行任务,且需用户明确授权。官方示例包括整理下载文件夹、找回丢失的文件、总结消息和笔记,下载地址为 http://ai.meta.com/muse/download/,并表示后续还有更多功能。

    引用Muse@Muse

    Muse is now available on Mac 💻. Your personal agent can get things done for you directly on your computer (all with your explicit permission). - Organize your downloads folder - Find a file you’ve lost track of - Summarize your messages and notes …more coming soon. Try Muse for Mac: http://ai.meta.com/muse/download/

  2. Josh Woodward46

    有家庭吗?我们家里就爱用这个。 @GoogleLabs: 全家一起 CC 🤝! 今天,我们宣布全新的 CC——一款为家庭打造的 AI 智能体,让大家少花时间处理琐事,多花时间相处。 你现在可以: 👤 最多添加 5 名成员到你的 CC 智能体 ☀️ 以共享的“Your Day Ahead”简报邮件开启每一天 🗓️ 通过共享的 Google Calendar 和 Tasks 自动同步日程与待办 💬 在 Google Chat 中与 CC 协作,分派相关任务(例如制定每周餐食计划、学校用品购物清单等) 📝 委派文书工作(例如许可单、表格等),由 CC 在你的指导下完成 📌 掌握细节——CC 会记住哪些适用于所有人(例如家庭购物清单、常去的餐厅),哪些只适用于某个人(例如饮食限制、本地时区) 准备好让全家人步调一致了吗?加入等待名单或升级你现有的 CC(仅限美国,18 岁以上):http://labs.google/cc

    引用Google Labs@GoogleLabs

    CC the entire fam 🤝! Today, we’re announcing the new CC – an AI agent built for families to spend less time on logistics and more time together. You can now: 👤 Add up to 5 members to your CC agent ☀️ Start mornings aligned with a shared "Your Day Ahead" brief email 🗓️ Autosync schedules & to-dos with a shared Google Calendar and Tasks 💬 Coordinate in Google Chat with CC to offload relevant tasks (ie., crafting weekly meal plans, school supply shopping lists, etc) 📝 Delegate paperwork (ie., permission slips, forms, and more) for CC to complete under your direction 📌 Keep tabs on the details – CC remembers what applies to everyone (ie., family grocery lists, favorite restaurants) versus what applies to one person (ie., dietary restrictions, local timezones) Ready to keep everybody on the same page? Join the waitlist or upgrade your existing CC (US only, 18+): http://labs.google/cc

  3. Noah Zweben55

    Claude 推出 Projects 功能,可在单一对话中管理项目,从 Claude Code 开始,由 Claude 调度多个并行线程,用户合上电脑后任务继续运行。该功能今日起对部分 Pro 和 Max 用户的云会话开放 Beta,将逐步向所有 Claude 用户推出。作者评论称通过单一协调者收集上下文、例行流程和输出,对管理复杂任务非常有价值。

    引用Claude@claudeai

    Projects now run from one conversation, starting in Claude Code. You describe what needs doing, and Claude directs parallel threads that keep working after you close your laptop. In beta today for select Pro and Max users in cloud sessions; coming to all Claude users soon.

  4. Noam Brown51

    OpenAI 的 Noam Brown 在 Dwarkesh 播客中深谈多智能体、Navier-Stokes 与当前数学进展对自动化 AI 研究和递归自我改进的启示。讨论还涵盖如何在启动 RSI 前判断模型是否真正对齐,以及思维链退化、内外部模型差距等话题,并感谢 OpenAI 团队在多智能体方面的工作。

    引用Dwarkesh Patel@dwarkesh_sp

    New episode with @polynoamial We talk about multi-agent, Navier-Stokes, and what the current explosion of maths progress tells us about what happens once you automate AI research. And we also discuss how we will know if the models are actually aligned before we kick off RSI. 0:00:00 – Multi-agent and Navier-Stokes 0:15:28 – How will AI firms work? 0:22:02 – What math progress tells us about recursive self improvement 0:40:22 – Hugging Face and alignment 1:01:18 – The internal/external model gap 1:08:34 – Chain of thought is degrading 1:14:12 – How will we know when alignment is solved?

9月17日周四
  1. jietang61

    唐杰称,由 GLM-5.3 驱动的基础设施智能体用两周时间让 GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量,端到端吞吐提升 3.2 倍。

    引用Z.ai@Zai_org

    We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure

  2. GitHub Blog · AI & ML78

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 Rust

    GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。

    推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。

  3. OpenRouter Announcements67

    OpenRouter 教程:用 TypeScript SDK 构建可靠的工具调用 Agent 循环

    OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。

    推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。

  4. Anthropic Research75

    Anthropic:Claude 四周内将 30 多个开源生物分子模型平均加速约 4 倍并开源代码

    Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。

    推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。

  5. Claude Blog48

    Balyasny 如何评估与治理 Claude Fable 5

    Balyasny Asset Management 在数千个真实金融任务上评测 Claude Fable 5,Fable 取得 89.4% 对前代生产模型 86.1% 的成绩,在复杂规划、分析和智能体执行上表现最突出。该机构自建 BAMAgent 平台,已支持数千个自主智能体 7×24 小时运行,Fable 成为其规划与分析阶段的首选模型。

  6. Claude Blog70

    Claude Code Projects 改版:从文件夹到对话式协调多线程

    Anthropic 宣布 Claude Code 的 Projects 改版,从文件夹形态变为对话式协调:Claude 会拆解目标、并行分配线程、审查输出并汇总结果,每个线程是一个独立的 Claude Code 云会话。

    推荐理由:官方说明改版后 Projects 的线程协调、共享记忆和灰度范围,读者可据此评估它对多会话编码流程的改变。

9月16日周三
  1. OpenAI News65

    OpenAI 推出 AI 驱动的广告体验

    OpenAI 推出新的 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。材料为 feed 摘要,未提供完整正文细节。

    推荐理由:原文给出 Sponsored Agents、营销工具及 HubSpot、Shopify 集成等要点,读者可以了解 OpenAI 广告业务的初步形态。

  2. Noah Zweben36

    想在你们团队用 Claude Tag 做 on-call 吗?现在正在用 Claude Tag 做故障分诊、有反馈想提? 开放 office hours——来约个时间(需要 Team 或 Enterprise 套餐) https://calendar.app.google/okZ8zcvCtzSpoRvy7

    引用ClaudeDevs@ClaudeDevs

    Here's how our team uses Claude Tag for on-call: When an alert fires in Slack, Claude pulls metrics, diffs deploys, and checks flags. It finds a likely cause and proposes a fix, which we can approve and merge. Every minute counts, so we love that it starts right away!

  3. Hugging Face Blog63

    IBM Research 为 ALTK-Evolve 推出 Consistency Analyzer,将智能体一致性缺口从 24.4pp 降到 12.0pp

    IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。

    推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。