跳到正文

#Agent

今日 85 条
7月27日周一
7月26日周日
  1. Berkeley AI Research44

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月25日周六
7月24日周五
7月23日周四
  1. Google Research67

    Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估

    Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。

    推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。

7月22日周三
  1. Sierra Blog64

    Sierra 复盘 MCP Gateway 建设:AI 优先工程组织的七条经验

    Sierra 分享为内部 agent 搭建 MCP Gateway 的七条经验,包括抓住所有权减少协调、用 mcp-gateway.md 提升编码 agent 一次成功率、多阶段流程防止跨客户数据访问,以及优先用 gh CLI 等 agent 熟悉的工具。目前 89% 的 Sierra 员工通过它连接 45 个服务,近三分之二提交来自社区。

    推荐理由:Sierra 工程师复盘 MCP Gateway 建设全程,给出协作机制、权限审计和工具取舍七条可迁移经验。

7月21日周二
  1. OpenRouter Announcements64

    OpenRouter 解析提示词缓存与粘性路由如何降低 Agent 多轮成本

    OpenRouter 发布教程讲解提示词缓存与粘性路由如何降低 Agent 多轮成本。缓存读取为输入价格的 0.1x 到 0.5x,Anthropic 缓存写入为 1.25x(5 分钟 TTL)或 2.0x(1 小时 TTL),未被复用的单次写入比不缓存更贵。

    推荐理由:原文给出各厂商缓存读写倍率、session_id 粘性路由用法和缓存未命中排查方法,读者可以直接照做降低 Agent 多轮成本。

7月20日周一
  1. Every latest articles61

    为什么有些 AI 工作流能坚持下来而另一些不能

    Every 作者 Katie 复盘自己放弃和留下的多个 AI 工作流,结论是关键在于工作流回报的速度与是否匹配真实工作习惯。她为 CEO 的 Tend 需求搭建的 Attention Desk 因问题不存在而弃用,管理日程的 Margot 因维护成本过高被搁置,而即时给到回报的 compound writing 插件成为日常核心。

7月17日周五
  1. Runway News47

    Runway 详解 Runway Agent 2.0 的构建思路

    Runway 近期推出 Runway Agent 2.0,可将单一想法转化为完整创意作品,并支持在界面内把视频片段、音频和图像整合到同一条时间线。该产品在 Physion Labs 的 Arc 1.0 benchmark 中于六款 AI 视频智能体中排名第一,评测覆盖电影质感、连贯性以及信任与安全。Agent 内置对不同模型强弱项的认知和技能层,面向营销人员及影视创作等场景。

7月16日周四
  1. Sierra Blog64

    Sierra 推出内部云 Agent 平台 Pinecone

    Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。

    推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。

7月14日周二
  1. AI as Normal Technology72

    Arvind Narayanan 在 ICML 演讲谈 AI 时代还剩什么工作

    Princeton 的 Arvind Narayanan 在 ICML Seoul 发表题为“还有什么工作留给我们做”的主题演讲,主张用 AI as Normal Technology 框架看待AI影响,并称实验室里程碑不会突然让人失业。他提出方法、产品、早期采用、适应四阶段,指出可靠性指标两年内仅提升五到十个百分点、适应阶段需要数十年;未来工作将从构建转向评估,人类应与AI形成“共同超级智能”。

    推荐理由:作者结合能力与可靠性的测量数据,把AI经济影响拆为四个阶段,给出职业适应与评估优先的判断框架。

7月10日周五
  1. Sierra Blog66

    Sierra 全员推行 Agent Pinecone 的五条经验

    Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。

    推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。

7月9日周四
  1. Mistral AI40

    Mistral Studio 为 Prompts 和 Skills 提供系统级记录管理

    Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。不可变版本、回滚、分类标签和审计日志等功能让 AI 行为可治理、可发现,并支持通过 MCP 服务器直接调用 Skills。该功能面向 Mistral Studio 客户开放,数据始终保留在企业边界内。

  2. Google Research61

    Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练

    Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。

    推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。

7月8日周三
7月7日周二
  1. Hugging Face Blog61

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六大仿真基准

    Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。

    推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。

7月6日周一
7月2日周四
  1. Mistral AI64

    Mistral 发布 Leanstral 1.5:6B 激活参数的开源形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。

    推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。

  2. Sierra Blog33

    Sierra Ghostwriter 黑客松:30 人用 AI 智能体三小时完成原本六个月的工作

    Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者(过半来自年营收超 $10B 的企业)无论技术背景如何,都做出了可运行的 AI 智能体。有人三小时完成原本需六个月的工作,还有人把 Ghostwriter 指向知识库后 15 分钟一次性生成智能体。现场产出涵盖理赔受理、贷款资格审核、药房福利语音智能体等,其中一个账户解锁智能体在活动结束前已部署到生产环境。

  3. elsewhere articles40

    Agent 元年第 500 天:GUI 退场、Headless 上位与 CLI 复兴

    真格基金「此话当真」与「十字路口」串台播客在 Agent 元年第 500 天复盘:Claude 3.5 Sonnet 在第 100 天前后为 Agent 提供能力基础并带火 Manus,第 300 天 Claude Code 刷屏。节目以 GUI 退场、Headless 上位、CLI 复兴、Skills 封装、Agentic Economy 萌芽为主线,讨论为何不该再投资 GUI 思维的软件。

7月1日周三
  1. Sierra Blog46

    Sierra 在 Agent Studio 推出 Experiments,让客户行为驱动 AI 智能体优化

    Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项实验默认按解决率和流失率降低等结果指标评估。Ghostwriter 会分析全部客户对话,将发现的模式转化为假设并在数分钟内发布为实验。团队可逐步放量,确认统计显著后将胜出版本推至 100% 流量。

6月30日周二
  1. OpenRouter Announcements74

    OpenRouter 数据分析:DeepSeek V4 上线后 token 份额从 9% 翻倍至 18%

    OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。

    推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。

  2. Claude Platform release notes79

    Anthropic 发布 Claude Sonnet 5,1M 上下文、$2/$10 每 MTok 定价并说明迁移变化

    Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。

    推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。

6月26日周五
  1. Dwarkesh Patel65

    Dwarkesh Patel:下一个突破是 AI 在工作中学习

    Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。

    推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。

6月25日周四
  1. Runway News41

    Runway 推出 Agent 2.0,面向营销场景的升级版智能体

    Runway 发布 Agent 2.0,一款面向营销人员的升级版智能体,已向所有用户开放。用户可在对话中导入广告投放、产品发布或目标受众等信息,Agent 会分析并提问,协助生成和优化营销内容。它支持从 Meta、YouTube、TikTok、Google 导入广告指标,并自动输出 9:16、16:9、1:1 等平台适配格式。