Sierra 谈上下文工程:打造优秀 AI 智能体的关键
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,即决定智能体在每个时刻能访问哪些信息、何时使用。其平台通过渐进式披露机制,仅在条件满足时向智能体提供最少且最相关的信息,避免无关 token 分散模型注意力。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,即决定智能体在每个时刻能访问哪些信息、何时使用。其平台通过渐进式披露机制,仅在条件满足时向智能体提供最少且最相关的信息,避免无关 token 分散模型注意力。
Sierra 宣布融资 9.5 亿美元,由 Tiger Global 和 GV 领投,估值超 150 亿美元,公司可投入资金超过 10 亿美元。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
Google Research 在 ICLR 论文中提出 Agent 记忆框架 ReasoningBank,从成功和失败经验中蒸馏可迁移的推理记忆用于测试时自进化,代码已在 GitHub 开放。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并可直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。
Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。
推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。
Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。
Runway 推出面向早期创业公司的 Runway Builders 计划,为 Seed 至 Series C 阶段公司提供最高 50 万免费 API credits、最高速率限制及 Runway Characters 的早期访问权限。
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。
Sierra 宣布收购东京企业 AI 初创公司 Opera Tech,其联合创始人 Keita Morikawa 与 Kiyohito Kunii 将一同加入。Sierra 称此举旨在拓展日本市场,并援引 Singtel 10 周上线、解决率超 70%,以及 Rocket Mortgage 月贷款规模达 $1B 等客户案例。
Sierra 推出以智能体构建智能体为核心的重构产品 Ghostwriter,用户上传 SOP、客服通话记录、白板草图等素材或用英文描述需求,即可生成支持语音、聊天、邮件和 30 多种语言、自带护栏的生产级智能体。
Google 推出 Vibe Coding XR 工作流,通过专门的系统提示词与 XR Blocks 代码模板,让 Gemini 将自然语言在 60 秒内转为可运行的、支持物理感知的 Android XR 应用。
Sierra 宣布在澳大利亚悉尼开设办公室,此前已扩展至新加坡、东京、马德里、巴黎和伦敦。其平台上的 AI 智能体支持 30 多种语言、全天候无等待服务,覆盖产品发现、注册登录、故障排查和流失管理。Rocket Mortgage 每月贷款量达 $1BN,使用其智能体的购房者完成流程的可能性高出四倍。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
Google Research 在 The Check Up 活动上展示了多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。
Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,采用 120B-A6B 稀疏架构,并可通过 Mistral Vibe 和 labs-leanstral-2603 API 端点使用。
Linear 发布视觉界面改版,通过调暗导航侧边栏、压缩顶部标签、减少图标使用并软化边框对比,让主内容区更突出。改版借助内置 dev toolbar 一键切换 feature flags 对比新旧版本,并用 Claude Code 在数小时内构建出可调 hue、chroma、lightness 的颜色工具,其 token 值以 JSON 导入 Figma。
对话式 AI 平台 Sierra 宣布在西班牙马德里开设办公室,并已与多家西班牙大型企业合作构建 AI 客户体验。Sierra 智能体可覆盖产品推荐、注册、账户管理、故障排查、忠诚度计划与流失管理等场景;英国零售商 Next 六周上线,覆盖 83 个国家 48 种语言,Cigna 八周投产并将患者认证时间缩短 80%,Singtel 十周上线,解决率超 70%。
Runway 发文说明其本周发布的实时视频智能体 API Runway Characters 的安全考量,该产品基于 World Model GWM-1,可从单张图像生成可对话的定制角色。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
Sierra 创始人 Bret Taylor 与 Clay Bavor 发布第二年度复盘,公司继七个季度达成 1 亿美元 ARR 后迎来首个 5000 万美元季度,进入第三年时 ARR 超过 1.5 亿美元。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
Sierra 发布 Expert Answers,可将 AI 智能体转交人工解决的客服对话自动生成可审核的知识文章,并回灌给智能体。该功能会识别智能体的知识缺口、学习相似问题的解决模式并生成草稿,供客服团队审核而非从零撰写。一家数字健康公司用其生成的文章测试部分流量,解决率提升 4% 且未增加客服工作量,随后全面铺开。
Novita AI 基于 SGLang 为 GLM4-MoE 推出一套生产级推理优化方案,通过 Shared Experts Fusion 与 Suffix Decoding 等技术,在 H200 集群 TP8、FP8 配置下将 TTFT 最多降低 65%,智能体编程负载下 TPOT 改善 22%。
Sierra 与 Stellarus 达成合作,帮助健康计划大规模部署 AI 智能体。双方与 Blue Shield of California 合作推出的 AI 语音智能体上线六个月,可 24/7 回答福利与覆盖范围等会员咨询,在数千次交互中取得 4.4(满分 5)的客户满意度评分。双方下一步将从被动支持转向主动的 AI 驱动互动。
Sierra 发布 Workspaces,将 GitHub、Figma 式的协作模式引入 AI 智能体开发,支持团队成员在各自 Workspace 中并行构建、测试,再通过合并生成快照并发布到 QA、staging 或生产环境。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、庆祝卡片等可视化 UI 组件。这些组件用 React 构建,可在 Agent Studio 中无代码部署,并支持无障碍、响应式与效果度量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Mistral 发布开源编码模型 Devstral 2(123B,修改版 MIT)和 Devstral Small 2(24B,Apache 2.0),SWE-bench Verified 分别达 72.2% 和 68.0%,均支持 256K 上下文。
推荐理由:官方给出了两个尺寸的开源编码模型参数量、SWE-bench Verified 成绩、API 定价和部署门槛,可与闭源竞品直接对比。
Mistral AI 宣布通过多项长期战略承诺扩展在德国的业务。其中与 SAP 建立多年期合作,将 Mistral 模型集成到 SAP AI Foundation,为德国和欧洲提供完全主权 AI 堆栈并共同开发面向复杂行业和行政机构的行业解决方案;与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还计划大幅增加德国本地团队,并在未来几个月开设德国办公室。