Sierra 推出 Linnaeus 与 Darwin 搜索模型,解决率最高提升 16 个百分点
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排),用于其客服 AI 智能体,解决率最高提升 16 个百分点。Linnaeus 直接处理完整对话,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责精准筛选,使搜索成本与 P90 延迟均下降超 75%。
媒体报道、公司博客与研究文章
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排),用于其客服 AI 智能体,解决率最高提升 16 个百分点。Linnaeus 直接处理完整对话,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责精准筛选,使搜索成本与 P90 延迟均下降超 75%。
Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。
研究团队提出 DBPlanBench,将 Apache DataFusion 的物理算子图经序列化压缩约 10 倍后交给 LLM 推理,让模型以 JSON Patch(RFC 6902)对现有物理计划做局部改写而非重新生成。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft 发布语音识别模型 MAI-Transcribe-1,定价 $0.36 每小时音频,称其在大规模云厂商中具备最优性价比。模型正在 Copilot Voice 模式和 Microsoft Teams 中分阶段部署,并已在 Microsoft Foundry 公开预览,同时可在新上线的 Microsoft AI Playground 体验。
Eric Eyken-Sluyters 加入 Sierra 担任现场运营总裁,负责全球销售、销售工程与合作伙伴团队。Sierra 上线两年已成为客户体验 AI 智能体领域的领先平台,服务 Fortune 50 中 40% 的企业,客户包括 ADT、Chime、Cigna、Nordstrom、Nubank、Rivian、Wayfair 等。Eric 拥有超过三十年构建和扩展高增长企业软件业务的经验。
Qwen 团队继 2 月发布 Qwen3.5 系列后,宣布 Qwen3.6-Plus 正式发布,现已可通过 API 使用。官方称该版本相比前代有大幅能力提升,尤其显著增强了智能体编码能力,覆盖从前端网页开发到复杂仓库级问题求解的场景。
推荐理由:官方宣布新一代模型上线 API,重点提升智能体编码能力,关注代码开发的读者可以对比前代评估升级幅度。
Google 发布 Gemma 4,包含 gemma-4-26b-a4b-it 和 gemma-4-31b-it 两款模型。两款模型已在 AI Studio 上线,并可通过 Gemini API 使用。
推荐理由:官方更新日志明确了 Gemma 4 两款模型的名称与获取渠道,可据此确认 Gemini API 的可用变化。
Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。
Manus Blog 发布 OpenClaw 与 Manus Desktop 的对比评测,通过开发者网站监控和营销人员竞品情报两个用例说明二者差异。
Together AI 内核团队起源于 2022 年 Memorial Day 周末发布的 FlashAttention,该工作将数据库系统的数据局部性与内存层级原理应用于 attention,实现 2–3x 加速。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了评测条目数与每条目标注者数的权衡,发现常用的 1–5 名标注者往往不足,可靠结果常需每条目 10 名以上标注者。
Gemini API 推出 Flex 和 Priority 两个新的推理层级,为用户在成本与延迟之间提供更多优化选择。
ElevenLabs 与欧盟理事会总秘书处合作,在 2025 年波兰担任欧盟理事会轮值主席国期间,将高层外交记者会配音为英语、法语和波兰语,20 余场在华沙举行的部长级会议内容由此向全欧公民开放。
Runway 推出面向早期创业公司的 Runway Builders 计划,为 Seed 至 Series C 阶段公司提供最高 50 万免费 API credits、最高速率限制及 Runway Characters 的早期访问权限。
Runway 正式推出 Runway Fund,专注投资 AI、媒体与世界模拟领域的早期公司,初期承诺投入最高 1000 万美元,单笔投资一般不超过 50 万美元,面向 pre-seed 和种子轮。该基金已低调运作数年,此前投资了 Cartesia、LanceDB 和 Tamarind Bio,重点关注 AI 研究、新应用以及新媒体与内容三大方向。
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。
Together AI 开源 Aurora,一个基于 RL 的框架,可从实时推理轨迹中学习并异步更新投机解码器,把静态的一次性配置变成持续自我改进的飞轮。在 Qwen3、Llama3 等模型上,Aurora 相比训练良好但静态的投机器再提速 1.25 倍,并省去大规模激活收集管线。代码已开源。
Gemini API 推出 Veo 3.1 Lite Preview(veo-3.1-lite-generate-preview),这是其最具成本效益的视频生成模型,面向快速迭代和高并发应用场景。同时,gemini-2.5-flash-lite-preview-09-2025 已停用,改用 gemini-3.1-flash-lite-preview。
SGLang 在 NVIDIA GTC 2026 期间举办五场活动,包括黄仁勋 GTC 主题演讲的 NVIDIA AI 生态幻灯片展示、开源 AI 专题讨论、官方训练实验室,以及与 RadixArk 联合举办的 Happy Hour 和 LinkedIn 约 200 人规模的 meetup。
千问发布新一代全模态大模型 Qwen3.5-Omni,支持文本、图像、音频及音视频内容的理解。模型采用 Hybrid-Attention MoE 架构,系列含 Plus、Flash、Light 三个 Instruct 版本,支持 256k 长上下文输入,可处理超过 10 小时的音频。
推荐理由:官方发布新一代全模态模型,列出了尺寸系列与长上下文等配置,读者可据此评估其在多模态场景中的适用性。
Sierra 宣布收购东京企业 AI 初创公司 Opera Tech,其联合创始人 Keita Morikawa 与 Kiyohito Kunii 将一同加入。Sierra 称此举旨在拓展日本市场,并援引 Singtel 10 周上线、解决率超 70%,以及 Rocket Mortgage 月贷款规模达 $1B 等客户案例。
Together AI 基于 ICLR 2026 论文提出分治框架,让 Llama-3-70B、Qwen-72B 等较弱模型在长上下文任务上匹配或超过 GPT-4o 单次全文处理。框架把噪声拆为模型噪声、任务噪声和聚合器噪声,指出调整提示词(如改为返回每块最小的两个数)可降低聚合噪声;方法在 QA、检索、摘要等跨块依赖中等任务上更便宜、更快、易调参,但在高跨块依赖任务上仍需单次全文处理。
Sierra 推出以智能体构建智能体为核心的重构产品 Ghostwriter,用户上传 SOP、客服通话记录、白板草图等素材或用英文描述需求,即可生成支持语音、聊天、邮件和 30 多种语言、自带护栏的生产级智能体。
Gemini 发布 gemini-3.1-flash-live-preview,这是最新的音频到音频(A2A)模型,面向实时对话与语音优先的 AI 应用。开发者可查阅 Live API 文档开始使用。
Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。
推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。
Google 推出 Vibe Coding XR 工作流,通过专门的系统提示词与 XR Blocks 代码模板,让 Gemini 将自然语言在 60 秒内转为可运行的、支持物理感知的 Android XR 应用。
Google Research 发布压缩算法 TurboQuant,可在零精度损失下大幅压缩模型,兼顾 KV cache 压缩与向量搜索,将亮相 ICLR 2026。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区与特征栅格化,将道路、建筑等建成环境数据转为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在人口密度、收入等社会经济预测的地理外推任务中,S2Vec 表现优于 SATCLIP、GEOCLIP 等基线,但在树冠覆盖、海拔等环境任务上仍需改进;与图像嵌入的多模态融合通常优于单一模态。
Gemini API 推出 Lyria 3 音乐生成模型,包含 lyria-3-clip-preview(30 秒片段)和 lyria-3-pro-preview(完整歌曲)两个版本。两款模型均支持文本和图像输入,可生成 48kHz 立体声高质量音频。
SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射并维护冗余专家,为 DeepSeek MoE 部署提供部分故障容错能力。在 DeepSeek V3.2 的 4 节点 32 GPU 测试中(ep_size=dp_size=32、256 个冗余专家),服务中断控制在 10 秒以内,较完整重启的 2–3 分钟减少 90%。
Sierra 宣布在澳大利亚悉尼开设办公室,此前已扩展至新加坡、东京、马德里、巴黎和伦敦。其平台上的 AI 智能体支持 30 多种语言、全天候无等待服务,覆盖产品发现、注册登录、故障排查和流失管理。Rocket Mortgage 每月贷款量达 $1BN,使用其智能体的购房者完成流程的可能性高出四倍。
Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。
推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。
Gemini API 在 AI Studio 上线 Prepay 和 Postpay 两种计费方案,现有账户可能受到影响,需查阅 Billing 文档了解详情。
Microsoft AI 团队发布图像生成模型 MAI-Image-2,称其使 MAI 进入 Arena.ai 榜单前三的文生图实验室行列。
推荐理由:原文给出榜单排名、可用入口和面向创意工作的三大能力重点,读者可据此判断是否试用或接入。
千问 Qwen3.5-Max-Preview 已在 Arena 部署,初步评测表现优异。官方表示将在未来两周内完成最终优化并正式发布,期间邀请社区通过 Arena 体验该模型能力。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
MiniMax 发布 M2.7 模型,称其为首个深度参与自身演化的 M2 系列模型,让模型构建 skills、更新记忆并改进强化学习实验流程。SWE-Pro 得分 56.22%,VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高;MLE Bench Lite 三次运行平均奖牌率 66.6%。
推荐理由:原文给出了自进化工作流细节和多维度基准数据,读者可以对照评估 M2.7 在智能体与工程任务上的实际位置。
Together AI 扩展 Together Fine-Tuning,新增工具调用、推理和视觉语言模型(VLM)微调支持,训练栈升级后最高 6 倍吞吐提升,数据集支持至 100GB,并在训练前后提供成本与完成时间预估。
Google Research 在 The Check Up 活动上展示了多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),发现其比单一任务应用更能支持长期健康。