Sierra Blog:AI 如何重塑客户体验(CX)的早期实践
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队转向根因修复并将实时洞察反哺产品开发。Wilson 的 AI 智能体可追问身高与偏好来推荐具体商品,Minted 则用 AI 智能体打通各客户平台,识别趋势并分发洞察。
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队转向根因修复并将实时洞察反哺产品开发。Wilson 的 AI 智能体可追问身高与偏好来推荐具体商品,Minted 则用 AI 智能体打通各客户平台,识别趋势并分发洞察。
Linear 工程师分享用 Linear Agent 自动修复进入 triage 的 bug 的经验。通过 Datadog 监控发现死 feature flag(任务形状固定,几乎每次一次修复成功)和失败的后台任务(失败率超 0.2% 时建 issue,约三分之一修复命中),并加入门控让 agent 先证明理解问题以节省 token。
Linear 发布 coding sessions、自动化 triage 和 Diffs,Linear Agent 可以从 issue 直接触达实现:阅读 issue 与讨论、调查代码库、提出方案、写代码并开 PR,全程在云端用 Claude Code 或 Codex 等模型与 harness 完成。
推荐理由:Linear 官方给出从 issue 到 PR 的完整执行闭环细节,并附自用数据与 Ramp、Coinbase 案例,读者可评估其对工程流程的影响。
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,可面向美国联邦机构提供 AI 智能体服务,此时距其成立仅两年多。该技术已被 40% 的 Fortune 50 企业采用,支持语音、聊天和邮件渠道及 58 种语言,全天候运行。Cigna 用其智能体在八周内投产,将患者身份验证时间缩短 80%。
Claude 平台的代码执行工具现已支持 code_execution_20260521,在工具描述中披露每单元格 90 秒执行时限,便于 Claude 为长耗时单元格做预算,且无需 beta header。
Linear 推出 Diffs 功能,用于应对智能体生成代码带来的审查压力:2026 年 1 月至 3 月,其团队新建 issue 与合并 PR 数量均上升 50%。该功能把审查集中到 Linear 内,支持一键查看代码变更背后的客户反馈或 bug 报告,并将改动分组为可读的叙事块,作者可直接在 Linear 中用智能体处理评论。
Anthropic 发布 Claude Fable 5(claude-fable-5)面向所有客户,Claude Mythos 5 面向 Project Glasswing 参与者。
推荐理由:官方发布说明完整列出两个新模型的能力参数、tokenizer 变化、API 行为改动和迁移注意事项,对计划接入或迁移的开发者有直接参考价值。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
SGLang 与 Miles 团队宣布 Day-0 支持 NVIDIA Nemotron 3 Ultra,一个面向长程自主智能体的开源推理模型,采用混合 Transformer-Mamba 架构的 Latent MoE,总参数 550B、激活 55B,上下文最长 1M token,支持 NVFP4 与 BF16 推理。
Microsoft AI 发文阐述其在医疗领域的产品与研究方向,称旗下消费产品每天处理数千万条健康问题,对 50 万条 Copilot 对话的分析显示用户依赖 AI 做症状解读、检查结果解释和就医导航。
推荐理由:微软官方阐述其在医疗领域的价值落地,读者可以据此了解 MAI DxO、Mayo Clinic 合作与 Copilot Health 的进展全貌。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
Claude Managed Agents 的 webhooks、多智能体编排和自托管沙箱现已在 AWS 上的 Claude Platform 提供。官方文档列出了新增的 IAM actions 和 AnthropicSelfHostedEnvironmentAccess 托管策略。
Mistral 在 AI Now Summit 2026 宣布面向工业工程的整体 AI 栈,并与 Airbus、BMW 和 ASML 合作,覆盖设计、仿真和生产场景。
Mistral 将 Le Chat 升级为统一智能体 Vibe,一个账号覆盖工作与编码场景,已上线 chat.mistral.ai。Work Mode 面向长时多步任务,支持企业知识搜索、数据分析、文档起草、定时任务和可复用技能;Code Mode 提供远程编码会话并推出 VS Code 扩展,CLI 新增技能命令、会话权限控制和 /teleport 迁移。
推荐理由:原文是 Mistral 官方发布,完整列出 Work 与 Code 两种模式的能力、集成入口和各档定价,读者可据此评估是否替换现有工作流。
Linear 发布代码评审产品 Diffs,面向所有套餐开放,目标是让代码评审在不牺牲严谨性的前提下保持快速。评审在 Linear 内打开并关联对应的 issue 和项目,优先级可见;Guided reviews 把大 diff 按工作的推理顺序拆成章节,先展示核心改动,结构化 diff 高亮会剥离格式改动,让 2000 行的 PR 在一次阅读中变得可读。
推荐理由:Linear 官方解释了 Diffs 针对的评审痛点与具体设计,读者可以对照自己团队被 agent 大量 PR 拖慢的评审流程判断是否适用。
Anthropic 发布 Claude Opus 4.8,为其最强模型,在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上默认支持 1M token 上下文窗口,最大输出 128k token。
推荐理由:原文完整列出 1M 上下文、采样参数限制和各端可用性等迁移要点,接入方可以直接对照判断升级路径。
Mistral AI 宣布与奥地利 Physics AI 公司 Emmi AI 达成最终收购协议,以加强面向工业企业的 AI 转型业务。Emmi AI 团队包括 30 多名研究人员和工程师,将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队,其大工程模型能力涵盖实时模拟、数字孪生等工程场景,应用于航空航天、汽车和半导体等领域。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。
推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。
Mistral 发布 Studio 的 Connectors(Public Preview),内置连接器和自定义 MCP 可通过 API/SDK 用于所有模型与 Agent 调用。
Sierra 已在多伦多开设办公室,目前约有十几名员工,客户数量持续增长。基于 Sierra 构建的 AI 智能体现已服务超过 40% 的 Fortune 50 企业,处理数十亿次客户交互。Singtel 上线用时 10 周,解决率超过 70%;Cigna 八周进入生产环境,患者身份验证时间缩短 80%。
Sierra 正在招聘并扩张其增长最快的团队 Agent Strategist,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位使用 Sierra 的 Ghostwriter 等工具,将客户旅程转化为可运行的智能体,并持续优化提示词与流程。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选逆转细胞衰老的基因线索,它扫描数万篇论文后提出 20 多个新颖候选遗传因子,其中数个经实验室验证成功将细胞推向更年轻状态并改善整体功能。Co-Scientist 还将原本需长达六个月的筛选数据分析缩短至几天。
Anthropic 在 Claude Managed Agents 中推出 dreaming 研究预览,并开放 outcomes、多智能体编排和 webhooks。
推荐理由:官方公布了 dreaming、outcomes 与多智能体编排的具体机制和内部基准数据,可了解 Managed Agents 的能力边界与实际收益。
Claude 平台发布更新:MCP tunnels 以研究预览形式上线,可连接私有网络中的 MCP 服务器。
Anthropic 宣布 Claude Managed Agents 支持自托管沙箱和 MCP 隧道,让智能体在企业自身边界内执行工具并访问私有网络中的 MCP 服务器。
推荐理由:原文给出自托管沙箱与 MCP 隧道的边界划分和支持的沙箱提供商,读者可据此评估企业内智能体部署路径。
Claude 平台的网页搜索工具现已返回更丰富的 SEC 文件数据,便于金融研究智能体、财报分析和尽职调查工作流基于一手来源并附引用。该更新于 2026 年 5 月 18 日发布。
MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 借助 Google DeepMind 的 Co-Scientist,将组织工程与 RNA 表面图谱两套工具结合用于 ALS 研究。
Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。
推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。
Sierra 发布 𝜏-knowledge,扩展其 𝜏-bench 对话基准,新增 𝜏-Banking 域,包含 698 篇文档、21 个产品类别(约 195K tokens),任务平均需查阅 18.6 篇文档和 9.5 次工具调用。
Runway 推出 Runway Agent,一个智能体创意伙伴,可在单次对话中从想法产出可发布的成品视频,包含多镜头画面、旁白、对白和音乐。用户用自然语言描述需求,可上传参考图、选择画幅比例和时长,逐步对话确定概念与故事结构后生成视频,再用时间线编辑器做最终调整,官方称可在数分钟内产出高分辨率多镜头视频。产品面向品牌团队、营销人员、创意机构、社媒内容团队和影视创作者,现已开放使用。
推荐理由:Runway 官方宣布 Agent 上线并给出工作方式与适用场景,读者可以据此判断对话式视频生产对内容团队的适用度。
Sierra 详解其始终在线的评估层 Monitors 如何被评估:每个 monitor 先基于真实对话人工标注的示例定义目标行为,再由多个模型评判并与团队标签比对,分歧处回炉迭代直至模型稳定一致。
Claude Managed Agents 的多智能体编排与 Outcomes 功能进入公测,使用标准 managed-agents-2026-04-01 beta header。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,即决定智能体在每个时刻能访问哪些信息、何时使用。其平台通过渐进式披露机制,仅在条件满足时向智能体提供最少且最相关的信息,避免无关 token 分散模型注意力。
Sierra 宣布融资 9.5 亿美元,由 Tiger Global 和 GV 领投,估值超 150 亿美元,公司可投入资金超过 10 亿美元。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。
Claude Managed Agents 的记忆功能现已进入公开测试,使用标准的 managed-agents-2026-04-01 header 即可调用。完整集成指南见 Using agent memory 文档。