Together AI 推出实时语音智能体统一解决方案,同集群共置 STT、LLM 与 TTS
Together AI 发布面向实时语音智能体的统一解决方案,将 STT、LLM 和 TTS 共置在同一集群内,用户语音结束到首个音频 token 的端到端延迟低于 500ms。
媒体报道、公司博客与研究文章
Together AI 发布面向实时语音智能体的统一解决方案,将 STT、LLM 和 TTS 共置在同一集群内,用户语音结束到首个音频 token 的端到端延迟低于 500ms。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。
推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。
Gemini API 为 AI Studio 的计费引入项目级支出上限(project-level spend caps),用于限制单个项目的花费。该功能于 2026 年 3 月 12 日上线。
Manus 发布首封年度信并推出 Manus 2.0,CEO Red 回顾了 Manus 从"AI 不仅应思考、更应行动"的构想出发,一年内已能构建含数据库和 AI 原生功能的全栈 Web 应用乃至移动应用。信中提出下一步目标:让不懂编程的人也能使用,并让 Agent 全天候 24/7 持续运行。
Runway 宣布成立内部孵化器 Runway Labs,专注探索生成式视频与 General World Models 的下一代应用。该孵化器由联合创始人兼首席创新官 Alejandro Matamala Ortiz 领导,负责孵化处于 AI 视频前沿的实验性产品。Runway 同时启动招聘,招募设计、ML、全栈及 AI 工程师与创业者。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
Together AI 在 Day 0 通过 Dedicated Inference 上线 NVIDIA Nemotron 3 Super,这是一款 120B 参数(12B 激活)的混合模型,结合 Transformer 与 Mamba 架构,支持 1M token 上下文窗口。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Microsoft AI 分析 2026 年 1 月超过 50 万条 Copilot 健康与 wellbeing 相关对话,发现近 1/5 对话涉及用户描述自身症状、解读检查结果或管理病情,约 40% 的问题聚焦症状、疾病和治疗信息。
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复等企业级能力。
Gemini 发布首个多模态嵌入模型 gemini-embedding-2-preview,支持文本、图像、视频、音频和 PDF 输入,并将所有模态映射到统一的嵌入空间。同时,gemini-2.5-flash-lite-preview-09-2025 将于 2026 年 3 月 31 日关停。
作者将Squarespace Blueprint AI、Wix AI、Shopify、Manus、Framer、10Web、Hostinger AI、Durable和Webflow放在三个相同的电商场景中评测AI实际生成的网站质量。
Gemini 3 Pro Preview 模型已被关停,原 gemini-3-pro-preview 现指向 gemini-3.1-pro-preview。
Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。
推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。
Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。
推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。
Manus 博客用同一段 8 分钟原始素材对十款 AI 视频剪辑工具做统一工作流评测,涵盖 Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip、Filmora 与 Manus 自身,价格截至 2026 年 3 月。
Together AI 团队发布 FlashAttention-4,通过算法与内核协同设计最大化 Blackwell GPU 上矩阵乘与其他资源瓶颈的重叠。在 B200 BF16 上达到最高 1605 TFLOPs/s(71% 利用率),前向比 cuDNN 9.13 快最高 1.3 倍、比 Triton 快最高 2.7 倍。
Together 在首届 AI Native Conf 发布七项研究与产品,覆盖内核、强化学习和算法推理优化三大方向。
Together AI 提出缓存感知的 prefill–decode 分离架构 CPD,在标准 PD 基础上新增 pre-prefill 节点层和三级 KV-cache 层级(GPU 显存、主机 DRAM、RDMA 分布式缓存),将低复用率的冷请求与高复用率的暖请求分流到不同计算资源。
Google 在 Gemini API 更新日志中发布 Gemini 3.1 Flash-Lite Preview,是 Gemini 3 系列首个 Flash-Lite 模型。模型页面提供规格、具体更新和开发者指引。
Together AI 推出全新品牌视觉形象,新形象由设计机构 Pentagram 参与打造,围绕其连接开源创新、系统研究与开发者体验的生态理念展开。Together AI 定位为 AI Native Cloud,提供从预训练到推理的全流程支持,Cursor 和 Decagon 等 AI 原生公司已在其平台上构建产品。
Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。
推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Together AI 推出 SF Streets 和 US Streets 两个语音识别基准,测试显示 15 个先进 ASR 模型对街名的平均转写错误率为 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% 对 64%)。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Gemini API 发布 Gemini 3.1 Pro Preview,这是 Gemini 3 系列的最新迭代版本。同时上线独立端点 gemini-3.1-pro-preview-customtools,更擅长优先调用自定义工具,适合同时使用 bash 和工具的开发者。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
Gemini API 宣布 gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 和 gemini-2.0-flash-lite-001 四款模型将于 2026 年 6 月 1 日关停。开发者需在此日期前迁移至其他模型。
Gemini API 于 2 月 17 日关停三款预览模型:gemini-2.5-flash-preview-09-25、imagen-4.0-generate-preview-06-06 和 imagen-4.0-ultra-generate-preview-06-06。上述模型已停止服务,开发者需迁移至其他可用版本。
千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。
推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。
MiniMax 发布内部 RL 框架 Forge,通过中间件解耦架构、Windowed FIFO 调度、前缀树合并和 CISPO 算法解决 Agent RL 的吞吐、稳定性与灵活性冲突。该框架在 MiniMax M2.5 训练中接入超过 10 万种真实 Agent 脚手架与环境,上下文长度达 200k,日吞吐量达百万级样本;前缀树合并带来 40x 训练加速。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
一篇发表于 Lawfare 研究论文系列的文章指出,先进 AI 默认不会帮消费者以更低成本获得理想法律结果,因为监管壁垒、对抗性动态和人类参与这三重瓶颈仍待解决。文章以 GPT-4 通过律师资格考试为背景,指出即便生产力提升、单项法律任务成本下降,诉讼双方仍会陷入工作量军备竞赛,总成本居高不下。
MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。
Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。