IBM 发布 Granite 4.2 推理模型家族并详解构建过程
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
Sierra 宣布在首尔开设办公室,正式进入韩国市场。其 Horizon 智能体可跨系统、跨渠道运行数周至数年,并借助 Context Engine 从每次交互中持续学习;Singtel 10 周上线后解决率超 70%,Next 6 周上线并覆盖 83 个国家 48 种语言,BBVA 30 天上线首个 Horizon 智能体。Sierra 按结果而非用量收费。
OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。
推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数等新复合特征。
Google DeepMind 发文回顾从 DQN、AlphaGo、AlphaStar 到 SIMA 2 的15年游戏AI研究,并宣布与 Fenris Creations 深化合作,以 EVE Universe 作为前沿AI研究环境。
Runway 企业业务今年增长逾一倍,NRR 超过 300%,一家 Fortune 20 客户使用量增长 17 倍。其企业客户已覆盖 Amazon、Microsoft、Allstate、Adobe、Robinhood 等,欧洲占企业客户群 20% 以上,日本成为亚洲最大市场。
Sierra 将 release governance 直接内置到平台,用 Agent Checks、Simulations、merge approval workflows 和 split traffic releases 把变更从 Workspace 安全推到线上对话。
DeepSeek 在 API 平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,通过设置 model='deepseek-v4-flash-vision-exp' 即可调用。
推荐理由:官方公布了多模态 Agent 基准成绩和调用方式,读者可据此判断其视觉 Agent 能力在现有模型中的位置。
Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具让模型多步检索、翻阅并验证复杂文档,可通过 Mistral Search Toolkit 及 Studio 和 Vibe 中的 Libraries 使用,无需微调。
推荐理由:官方给出多步检索循环的完整工具设计和两个基准的具体数字,读者可据此评估它替代一次性 RAG 的适用场景。
Google 宣布在 Search 的 AI Mode 和 AI Overviews 中推出 5 项学习工具。
推荐理由:原文列出了五项学习功能各自的入口、覆盖范围和上线节奏,读者可以据此了解 Google 搜索在 AI Mode 里的教育能力布局。
Claude API 的 computer use 工具以 computer_toolset_20260801 转正,去掉 beta header,支持批量动作、默认缩放和经 configs 的按成员配置,并新增由应用托管浏览器的 browser use 工具集 browser_toolset_20260801。
LMSYS 与生态伙伴发布 Miles v0.1,一个基于 slime 设计的全栈生产级后训练系统,目标是让前沿规模 RL 训练更易用。
推荐理由:官方完整走读 Miles 的 RL 训练环路与关键数字,读者可据此评估它是否适合承担自己的前沿规模后训练任务。
OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。
推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。
Google 开源了一个基于 Agent Development Kit 和 Gemini 的零信任客服退款智能体参考实现,展示单条提示词注入即可触发越权退款和环境变量泄露。
推荐理由:原文用可运行的开源示例拆解智能体三层零信任防护,读者可以照着在自己的 ADK 工作流里落地签名、沙箱和网关。
Sierra 宣布在慕尼黑开设办公室,服务德国、奥地利和瑞士的企业客户。Sierra 帮助企业构建客服与营收 AI 智能体,客户包括全球领先银行中的三分之一、Fortune 50 中的 40%,BBVA 的智能体 30 天上线,Next 用 42 天,Singtel 用 56 天。
Cursor 宣布 Firetiger 团队加入。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,构建监控发布、发现回归、调查事件并将发现反馈给编程智能体的智能体。双方将打通从编写代码到生产环境运行的路径,这项投入还包括 Git forge Cursor Origin 和即将推出的 Change Monitors。
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
Sierra 提出在智能体时代以"纵深防御"保障 AI 行为边界,让每条客户消息在回复前经过内容、规则与政策、监督模型、确定性守卫等多层检查,单条消息可触发多达六项校验。Sierra 的智能体基于目标与护栏构建,可自主推理而非沿预设流程执行。运行时之外还包括持续评估、持续监控与上线前 Simulations 压力测试。
Cursor 宣布通过 AIUC-1 智能体安全、安全性与可靠性认证,该标准结合独立审计与对抗性测试,由 Schellman 审计,并获 MITRE、Cloud Security Alliance 及 Stanford 研究人员技术支持。
Cursor 推出构建,即在后台预先准备好的可直接使用的开发环境副本,默认每小时创建一次,无需额外费用。智能体直接在已就绪环境中启动,Cursor 内部环境启动快 10 倍、首个 token 生成快 3 倍;构建失败时智能体回退到上一次成功构建,8 月 17 日起所有环境默认启用。
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。
推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。
Sierra 的 Horizon 智能体可为保险客户提供长周期主动跟进,从报价到成交持续数天、数周甚至数月,直到客户购买或放弃。文中示例中,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款并演示加购影响,第 7 天完成电话确认,客户当晚即购买保单。Sierra 称该智能体遵循企业及行业最佳实践,沟通内容由企业控制。
Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。
OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。
推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
Sierra 推出开箱即用的 IVR 导航能力,让智能体能打电话穿越多级菜单、判断何时沉默、发送 DTMF 按键音并识别真人接听。评测显示开启该功能后整体通过率提升 49%,从 57% 到 85%,其中「联系到人」类任务提升最大;客户包括一家 top 5 医疗支付方和一家全国性数字药房。
IBM Research 在 AppWorld 上自跑对比 ALTK-Evolve 与 ACE,两者都把智能体历史轨迹转成可复用经验且都不压缩经验,核心差异在交付:ACE 每步注入完整 playbook,ALTK-Evolve 按模型能力选择性检索 guideline。
Google 发文论证 Go 是 AI 辅助软件工程的理想语言:当 AI 智能体可秒级生成数百行代码,开发者重心从编写转向审查与维护,语言的可读性和工具链一致性变得更重要。Go 自带格式化、测试框架、依赖管理与安全工具,能让 AI 更快、更便宜、更可靠地处理代码,并减少上下文窗口污染与 token 成本。
Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。
推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,可跨品牌、市场与语言复用同一底层智能体。该功能结合语音、个性与语言感知行为,支持智能体在对话中调整语速、应对打断并切换语音或语言,由多种语音模型按场景择优驱动。Sierra 称某智能体搭配自然语音与人格后解决率提升近 50%,Voice Personas 现已上线。
Claude Managed Agents 更新四项能力:可为会话设置硬性花费预算,达到预算后以 budget_reached 停止原因暂停,修改或移除预算即恢复。
Sierra 发布 Context Engine,把企业已有的客户画像、账单、购买、工单等数据与智能体每次交互产生的新上下文结合,驱动可运行数天至数月的 Horizon 智能体持续追求业务结果。
OpenRouter 发布 ori CLI,安装并登录后可自动为 Claude Code、Codex、OpenCode、Hermes 等生成适配 OpenRouter 的优化配置。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
Plaid 与 Sierra 达成合作,客户可在 Sierra 的 AI 智能体内直接安全连接银行账户,无需离开对话即可完成支付或财务验证。Sierra 上月推出的 Horizon 平台支持智能体跨数天、数周甚至数月主动推进再融资、催收逾期款项或保险理赔等长周期任务。该集成以消费者明确授权为前提,并配备合规监控与人工介入机制。
OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。
推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自动科研原型 Science One Framework 与配套的 CoE Audit 评估指标。
DeepSeek-V4-Flash 正式版 API 上线公测,调用方式不变,模型名设为 deepseek-v4-flash 即可使用。
推荐理由:官方给出完整的 Agent 基准分数和调用方式,读者可以直接评估是否切换到 deepseek-v4-flash 正式版。