Gemini Enterprise Agent Platform 的智能体与模型评估服务正式 GA
Gemini Enterprise Agent Platform 的智能体与模型评估服务现已正式可用,为开发者提供统一引擎,在本地开发实验与线上生产流量中一致衡量智能体质量。
推荐理由:评估服务正式可用并给出 20 多项指标与接入入口,读者可据此判断智能体评测如何融入现有开发流程。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
当前仅显示精选新闻Gemini Enterprise Agent Platform 的智能体与模型评估服务现已正式可用,为开发者提供统一引擎,在本地开发实验与线上生产流量中一致衡量智能体质量。
推荐理由:评估服务正式可用并给出 20 多项指标与接入入口,读者可据此判断智能体评测如何融入现有开发流程。
Agent Plugins 1.0.0 是一项厂商中立的目录规范,由 Google、Amazon、Microsoft 等支持,可将 Agent Skills 与 MCP server 打包成单一可移植单元。
推荐理由:规范统一了 Agent Skills 与 MCP server 的打包方式,读者可据此判断跨 IDE 兼容的成本。
MCP 第五个规范版本 MCP 2026-07-28 发布,协议核心从有状态双向模型改为请求/响应无状态模型,并纳入 MCP Apps 与 Tasks 标准化扩展,授权对齐生产环境的 OAuth 2.0 与 OIDC。
推荐理由:MCP 2026-07-28 把协议核心改为无状态并引入扩展框架,读者可据此判断服务器部署与扩展方式的变化。
Claude Code 的自动模式现已改为默认设置,由分类器评估每个待执行动作并拦截可能有害的命令,取代逐条人工批准权限提示。Anthropic 称内部评估中分类器发现的危险操作多于开发者手动点击批准时,且在第三方红队测试下表现稳定;由于会话打断更少,Claude 在两次中断之间的连续工作时间是此前默认设置的 9 倍。
推荐理由:官方给出自动模式在 Nuro、Gusto、Garner Health 生产环境的落地细节,可了解分类器在速度与安全之间的取舍。
OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。
推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。
LangChain 宣布 Managed Deep Agents 进入公开测试,开发者可用 Python 或 TypeScript 编写 Deep Agent 并本地测试,再用 mda deploy 一条命令部署到 LangSmith 托管运行时。
推荐理由:原文列出托管运行时接管的持久化、沙箱与记忆等基础设施,并说明用户仍可控制的部分,便于判断是否把原型迁到生产。
LangChain 发布 Deep Agents v0.7,通过删除底层基础系统提示词、裁剪 43% 内置工具描述并把 TodoListMiddleware 改为可选,默认智能体单轮的基础输入 token 减少 65%(约 6k 降至约 2k)。
推荐理由:发布给出了删减提示词后的 token 与成本对比数据,可用来判断精简 harness 对现有智能体工作流的影响。
DeepSeek 释出自家 Coding Agent 产品 DeepSeek Harness,以「一切皆插件」为内核原则,当前为 developer preview 版本 0.1.0-rc.5、MIT 许可。
推荐理由:文章拆解了 DeepSeek Harness 的 Cordis 插件内核与四种运行模式,便于对照 Claude Code、Codex 理解其设计取舍。
DeepSeek Harness 已发布,底层框架 Cordis 只管插件加载和依赖,模型、工具、策略、存储、上下文、UI 都以插件形态存在,以 MIT 协议开源并已获 10K+ star。
推荐理由:原文列出 Harness 的插件化架构与 PTC 工具调用模式,可据此判断它对 Agent 工作流的影响。
DeepSeek 发布 DeepSeek Harness v0.1 开发者预览,面向全球构建 agent harness 的开发者开放,代码库以 MIT 许可证开源。
推荐理由:官方开放了开发者预览并说明一切皆插件的架构设计,开发者可以据此评估是否用它搭建智能体。
DeepSeek 开源了开发者预览版智能体框架 DeepSeek Harness,它是一套用来构建、运行和扩展智能体的 SDK 与应用框架,默认可连接 DeepSeek 模型,开源地址在 GitHub。
推荐理由:作者以提前内测的第三方身份跑通游戏与 3D 动画案例,展示了这套插件化智能体框架的组装方式与能力边界。
DeepSeek Harness 开发者预览版上线并开源,定位为类似 Claude Code 的 Agent 框架。它采用插件式架构,模型、工具、技能、会话、沙箱、循环、UI 等能力均由可替换的插件组合,基于具备时空可组合性的 Cordis 插件系统构建。
推荐理由:全文拆解了 DeepSeek Harness 的插件化架构与模式设计,读者可据此判断这类 Agent 框架的定制边界与取舍。
Cursor 推出 builds 功能,在后台预先准备可直接使用的开发环境副本,让云端智能体启动最高快 3 倍;Cursor 内部环境启动快了 10 倍,首个 token 生成快了 3 倍。builds 默认每小时创建一次,智能体始终基于最新的成功构建启动,构建失败时继续沿用上一次成功构建,工作不中断。8 月 17 日起,所有新建和现有环境将默认使用 builds,且不额外收费。
推荐理由:Cursor 公布云端智能体启动变快 3 倍的后台预构建机制,并说明迁移与调试方式。
Claude Cowork 现已作为 Chrome 侧边栏运行,能读取用户已登录的页面并执行阅读、点击、输入和填写表单等操作。技能、插件和连接器首次可在浏览器中使用,对话会保存到历史记录,会话随账号而非设备保留。任务可在浏览器标签页开始,随后在桌面端或手机上继续。
推荐理由:Claude Cowork 进入浏览器侧边栏,读者可了解技能与连接器如何让智能体直接操作用户已登录的网页。
Suno 发布 Studio 2.0,现向 Premier 订阅者开放。新增时间线 MIDI 导入、录制与编辑,可用 MIDI 剪辑作为生成提示词,附带新的 wavetable 合成器;另推出 Chat bar(beta)协作创作、高级 stem 分离、音频效果与自定义插件、自动化曲线,并支持无损导出 32-bit/48kHz 多轨与 stems。插件创建目前不消耗 credits。
推荐理由:官方发布新增 MIDI、Chat bar、自动化等能力,音乐创作者可据此判断 Suno Studio 2.0 是否融入现有工作流。
WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。
推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。
Claude 在 Chrome 的侧边栏会话已改为 Claude Cowork 会话,对话会保存到历史记录,技能和连接器可在浏览器中使用,在标签页里开始的任务能在桌面端、网页端和移动端接续完成。
推荐理由:官方说明了侧边栏会话与多端打通后的连续工作方式,也交代了浏览器智能体面临的提示词注入风险和新增的动作检查。
Anthropic 宣布 5 天后所有 Claude Code 将默认启用自动模式,分类器每次工具调用额外消耗的 token 不再向用户收费。文中数据显示用户对权限提示的拒绝率仅 3%,在 1053 名付费测试者的受控实验里人工拦下危险命令的比例为 13.6%,auto mode 为 89%。
推荐理由:用受控实验和生产数据对比人工审批与自动模式的拦截率差异,可看清这次默认变更的取舍依据。
OpenRouter 发布重大更新的 Auto 路由器(openrouter/auto),基于平台每周超 55T token 的真实消费数据选择模型,并已向所有用户开放。
推荐理由:基于 55T 周消费数据的市场化路由思路,附各任务基准与成本对比,读者可据此评估是否切换自己的 Auto 路由配置。
Suno 官宣 9 月 3 日起按订阅档位实施下载限额,Free 用户终身仅 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次,Suno Studio 无下载限制,超出部分可购买。同时推出新服务条款,付费计划下载的歌曲保留商用权,此前所有歌曲仍可播放和分享;新一代 Suno 模型即将上线,发布时旧模型将全部退役。
推荐理由:官方说明给出各档下载限额、免费用户终身额度等关键细节,对现有用户判断订阅与商用权利有直接参考价值。