OpenAI 推出 AI 驱动的广告体验
OpenAI 推出新的 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。材料为 feed 摘要,未提供完整正文细节。
推荐理由:原文给出 Sponsored Agents、营销工具及 HubSpot、Shopify 集成等要点,读者可以了解 OpenAI 广告业务的初步形态。
OpenAI 推出新的 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。材料为 feed 摘要,未提供完整正文细节。
推荐理由:原文给出 Sponsored Agents、营销工具及 HubSpot、Shopify 集成等要点,读者可以了解 OpenAI 广告业务的初步形态。
Here's how our team uses Claude Tag for on-call: When an alert fires in Slack, Claude pulls metrics, diffs deploys, and checks flags. It finds a likely cause and proposes a fix, which we can approve and merge. Every minute counts, so we love that it starts right away!
Gemini Enterprise Agent Platform 推出 Agent Anomaly Detection 私密预览,这是一个基于推理的智能体监督与审计层,通过分析 reasoning traces、工具调用和执行流程识别行为异常、可疑意图与策略违规。
ByteByteGo 重启为期 2 天的 Build with Claude Code 强化课程,由曾培训 Meta 数百名工程师的 John Kim 主讲,9 月 16 日开课,报名 24 小时后截止。
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
Anthropic 宣布 Claude Cowork 与聊天合并为一个统一 Claude,同时推出 Claude Docs 和 Claude Slides,Claude Design 也可在对话中使用。
推荐理由:官方说明了合并动机和推送节奏,读者可据此判断聊天里直接交付文档、幻灯片会怎样改变日常使用。
Sakana AI 为其研究智能体 Sakana Marlin 新增两项功能:Interactive Reading 支持以聊天方式就报告提问、跳转相关段落,并点击引用由 AI 打开源文件定位对应依据;PowerPoint 导出可生成可编辑幻灯片,修改文字、图形及表格图表的数据和格式,每页附来源 URL,并支持任意模板。
inclusionAI 在 Hugging Face 开源 LLaDA-UI,一个基于 MoE 的块扩散视觉语言 GUI Agent,总参数约 16.7B,语言骨干为 LLaDA2.0-mini-base。
Descript 发布案例研究,介绍其视频编辑智能体 Underlord 采用 OpenRouter 后,生产模型从 1 个增至 13 个(来自 4 家模型开发方),新模型评测时间从一周以上缩短到 1-2 小时,一次 Anthropic 发布从宣布到上线只用了几小时。
Google Developers Blog 发布零信任 Agent 系列第二篇,将安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时。
Anthropic 与 Salesforce 合作发布 Salesforce in Claude 测试版插件,将销售人员的客户、商机和管道数据在现有 Salesforce 权限下接入 Claude,并提供 37 个技能覆盖客户调研、通话准备、管道复盘和 CRM 更新等日常工作。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、Stripe、Zoom、Xero、Zapier 等工具,产品自 5 月上线以来安装量超过 900,000 次。
推荐理由:官方公布了新增工作流与集成数量,并给出多个客户的可验证使用结果,读者可据此评估这类 Agent 产品对小型业务的落地形态。
Google DevFest 2026 于 10 月 1 日至 12 月 31 日回归,由全球 Google Developer Groups 在 115 个国家举办 800 多场活动,预计近百万开发者参与。
前 LinkedIn、Twitter 产品负责人 Josh Elman 撰文指出,AI 把开发成本降到极低后,产品开发循环从先写 spec 再构建反转为先快速原型再设计,spec 不再是交付物,但判断成本没有下降,决定做什么才是产品经理的整个工作。
推荐理由:作者结合 LinkedIn 和 Twitter 的一线产品经历,说明 AI 如何把产品开发从写规格文档改为先做原型再做判断,方法论可直接迁移。
Fyxer 基于 OpenAI 模型、微调、记忆机制与真实用户反馈,打造出能整理收件箱并按每位用户语气起草邮件的 AI 行政助理。
Perplexity 正使用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,且相比早期模型,人工检查频率大幅降低。
OpenRouter 发布教程,讲解如何用独立的 judge 模型按书面评分标准自动给 Agent 输出打分,弥补确定性测试无法检查最终回答质量的问题。
推荐理由:原文给出可复用的评测方法和 Ori Eval 具体代码,覆盖评分模式选择与 judge 校准的实操细节。
LangChain 博客总结医疗与生命科学行业智能体规模化经验:76% 受访机构将 tracing、评估和支出可见性列为扩大智能体自主权的前提,49% 正在建设公司级智能体平台或“agent factory”,33% 聚焦已有纸质记录的受监管文档与后台流程,26% 在运行或构建面向患者和会员的对话式智能体(含语音),另有 26% 尝试让非工程师在中央护栏内构建智能体。
LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。
推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。
git revert 不重写历史,而是新建一个提交来撤销早先提交的改动,因此当后续提交修改了同一批代码行时就会触发冲突。例如 C2 添加功能、C3 又改了这些行,撤销 C2 便会与 C3 的改动相撞,Git 无法判断哪个版本正确。解决方式是运行 git revert C2,在冲突处暂停后手动修改文件、暂存并继续,最终生成一个干净撤销 C2 且保留 C3 的新提交。
GitHub 日本与韩国营销负责人 Tomoko Tanaka 撰文分享如何不写代码,用 GitHub Copilot 把活动运营从策划到会后跟进全流程自动化。
推荐理由:作者以自身营销流程为例,展示如何用 runbook 加 Copilot 在 GitHub 上搭建自动化,方法可迁移到其他重复性工作。
Cognition 借助 GPT-6 Astra 提升了 Devin 测试软件并证明其可用的能力,目标是让工程师减少代码审查、加快交付。
Google 推出 autofinetune,将自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
GitHub Copilot app 新增内置 diff、终端和浏览器面板,让新手不用离开应用即可审查 agent 改动、运行命令并预览界面。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。
OpenAI 推出 ChatGPT Work 中的 Data agent,可用自然语言连接公司数据、挖掘洞察并借助 AI 构建交互式仪表盘。
Cursor 推出 Projects,可承接一项功能、一次迁移或完整应用等大规模工作,在长达数月的工作中维持上下文,并向数千个子智能体委派任务。它由不写代码的协调智能体统一指挥,核心包括默认云端运行、跨机器同步的共享上下文,以及监听 Slack、按计划运行和跟进 PR 的订阅能力。
推荐理由:官方说明给出协调机制、共享上下文和订阅三类核心功能,以及内部使用数据,读者可据此评估是否纳入自己的开发流程。
OpenRouter 发布 Presets 使用教程,介绍如何把模型选择、系统提示词、provider 路由和采样参数存为一个命名且有版本的配置,并在任意 API 请求中通过 "model": "@preset/名称" 引用。
OpenAI 发布 Agents API,一项用于构建和上线云端智能体的托管服务,底层由 Codex harness 驱动,支持编排、长时间运行会话和工具调用。
推荐理由:OpenAI 官方宣布 Agents API,读者可从中了解其托管架构与工具调用能力如何服务云端智能体开发。
a16z 的 Marc Andreessen 宣布第二次投资 Cognition,并回顾软件吞世界的判断。
a16z 领投 Lightfield 4700 万美元 A 轮融资,这是一款面向智能体时代的 AI 原生 CRM。它采用无需配置的灵活数据模型,可从邮件和通话中自动构建,底层是捕捉每笔交易背后原因的时间上下文图谱,智能体与人类通过同一 API 在同一平台协作。Lightfield 自去年年底推出以来已有数千家公司采用,部分团队正弃用 Salesforce、HubSpot 和 Attio 转投。
Claude Managed Agents 权限策略新增 auto 模式,由服务端评估每个 agent 或 MCP 工具调用并自动运行、拒绝或暂停等待审批,agent.tool_use 与 agent.mcp_tool_use 事件新增 evaluation 字段说明评估结果。