Together GPU Clusters 新增自动扩缩容、可观测性与自愈能力
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复等企业级能力。
媒体报道、公司博客与研究文章
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复等企业级能力。
Gemini 发布首个多模态嵌入模型 gemini-embedding-2-preview,支持文本、图像、视频、音频和 PDF 输入,并将所有模态映射到统一的嵌入空间。同时,gemini-2.5-flash-lite-preview-09-2025 将于 2026 年 3 月 31 日关停。
作者将Squarespace Blueprint AI、Wix AI、Shopify、Manus、Framer、10Web、Hostinger AI、Durable和Webflow放在三个相同的电商场景中评测AI实际生成的网站质量。
Gemini 3 Pro Preview 模型已被关停,原 gemini-3-pro-preview 现指向 gemini-3.1-pro-preview。
Replit 在博客中介绍 Replit Animation 功能,让开发者在构建应用的同一工作区内用自然语言生成动效风格的发布视频,不必外包给动效工作室。
推荐理由:原文介绍了 Replit Animation 的来源、使用步骤和提示词技巧,读者可据此判断是否将其纳入发布视频工作流。
Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。
推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。
Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。
推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。
Manus 博客用同一段 8 分钟原始素材对十款 AI 视频剪辑工具做统一工作流评测,涵盖 Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip、Filmora 与 Manus 自身,价格截至 2026 年 3 月。
Together AI 团队发布 FlashAttention-4,通过算法与内核协同设计最大化 Blackwell GPU 上矩阵乘与其他资源瓶颈的重叠。在 B200 BF16 上达到最高 1605 TFLOPs/s(71% 利用率),前向比 cuDNN 9.13 快最高 1.3 倍、比 Triton 快最高 2.7 倍。
Liquid AI 发布开源桌面智能体 LocalCowork,基于 LFM2-24B-A2B 在 Apple M4 Max 笔记本上实现完全本地运行,模型、工具与数据均不出设备,源码可在其 Cookbook 获取。
Together 在首届 AI Native Conf 发布七项研究与产品,覆盖内核、强化学习和算法推理优化三大方向。
Together AI 提出缓存感知的 prefill–decode 分离架构 CPD,在标准 PD 基础上新增 pre-prefill 节点层和三级 KV-cache 层级(GPU 显存、主机 DRAM、RDMA 分布式缓存),将低复用率的冷请求与高复用率的暖请求分流到不同计算资源。
PromptArmor 披露 GitHub Copilot CLI 存在命令验证绕过漏洞,可通过 README 中的间接提示词注入,利用内置只读命令列表中的 env 包装 curl 和 sh,在无用户审批的情况下下载并执行恶意软件,实现远程代码执行。
推荐理由:原文给出完整的命令解析绕过链和复现命令,读者可以对照检查自己使用 Copilot CLI 时的审批配置。
Google 在 Gemini API 更新日志中发布 Gemini 3.1 Flash-Lite Preview,是 Gemini 3 系列首个 Flash-Lite 模型。模型页面提供规格、具体更新和开发者指引。
Together AI 推出全新品牌视觉形象,新形象由设计机构 Pentagram 参与打造,围绕其连接开源创新、系统研究与开发者体验的生态理念展开。Together AI 定位为 AI Native Cloud,提供从预训练到推理的全流程支持,Cursor 和 Decagon 等 AI 原生公司已在其平台上构建产品。
Factory 将于 3 月 9 日在伦敦开设新办公室,作为服务欧洲客户的中心。该办公室正在招聘 GTM 与运营岗位,涵盖销售、客户成功、市场、运营、部署工程和解决方案工程。
平面设计师 Ruth Heasman 借助 Replit Agent,在 Replit 移动端 Buildathon 中一周内做出 AR 捉鬼游戏 Spookseek AR,并已提交 TestFlight 公测。
Replit 介绍其视频渲染引擎:向页面注入约 1200 行脚本,替换 setTimeout、requestAnimationFrame、Date.now 等时间 API,让浏览器按 1000/fps 毫秒逐帧推进,从而把任意 URL 的动画确定性导出为 MP4。
Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。
推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。
Replit 推出新 Pro 计划,定价 $100/月,提供 Turbo Mode、$100 到 $4,000/月的分级积分、15 名协作者、优先支持和 28 天数据恢复。
推荐理由:原文给出了两档订阅的价格、功能和 Agent 模式差异,可帮读者按团队规模和用量判断选哪档。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Together AI 推出 SF Streets 和 US Streets 两个语音识别基准,测试显示 15 个先进 ASR 模型对街名的平均转写错误率为 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% 对 64%)。
非技术背景的 SaaS 设计师 Dan Kempe 借助 Replit Agent、Expo 和 Replit 新移动工具,在移动 Buildathon 期间独立开发出速读新闻 iOS 应用 Flash News,上线后下载量接近 300 次。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Gemini API 发布 Gemini 3.1 Pro Preview,这是 Gemini 3 系列的最新迭代版本。同时上线独立端点 gemini-3.1-pro-preview-customtools,更擅长优先调用自定义工具,适合同时使用 bash 和工具的开发者。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
Replit 推出与 Databricks Apps 和 Databricks AppKit 的集成,企业用户可在 Replit 中构建应用后部署到 Databricks,继承其治理、安全与可观测性能力。该集成支持从 AppKit 模板起步、团队实时协作,并用 Replit 的 AI 工作流按 AppKit 模式生成代码。目前开放早期访问申请,现有 Replit 客户可通过客户团队获取预览权限。
Gemini API 宣布 gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 和 gemini-2.0-flash-lite-001 四款模型将于 2026 年 6 月 1 日关停。开发者需在此日期前迁移至其他模型。
Gemini API 于 2 月 17 日关停三款预览模型:gemini-2.5-flash-preview-09-25、imagen-4.0-generate-preview-06-06 和 imagen-4.0-ultra-generate-preview-06-06。上述模型已停止服务,开发者需迁移至其他可用版本。
千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。
推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。
MiniMax 发布内部 RL 框架 Forge,通过中间件解耦架构、Windowed FIFO 调度、前缀树合并和 CISPO 算法解决 Agent RL 的吞吐、稳定性与灵活性冲突。该框架在 MiniMax M2.5 训练中接入超过 10 万种真实 Agent 脚手架与环境,上下文长度达 200k,日吞吐量达百万级样本;前缀树合并带来 40x 训练加速。
Replit 与 Snowflake 联合 webinar 第二部分演示如何把 Snowflake 数据看板升级为可用的数据工具:通过 Replit Agent 用自然语言提示词加入未来 15 天收入预测、下钻分析和 Slack 阈值告警,并嵌入可回答自然语言问题、同时展示所执行 SQL 的 AI 数据助手。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
一篇发表于 Lawfare 研究论文系列的文章指出,先进 AI 默认不会帮消费者以更低成本获得理想法律结果,因为监管壁垒、对抗性动态和人类参与这三重瓶颈仍待解决。文章以 GPT-4 通过律师资格考试为背景,指出即便生产力提升、单项法律任务成本下降,诉讼双方仍会陷入工作量军备竞赛,总成本居高不下。
MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。
Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。