Gemini 3.1 Flash-Lite Preview 发布,为 Gemini 3 系列首个 Flash-Lite 模型
Google 在 Gemini API 更新日志中发布 Gemini 3.1 Flash-Lite Preview,是 Gemini 3 系列首个 Flash-Lite 模型。模型页面提供规格、具体更新和开发者指引。
媒体报道、公司博客与研究文章
Google 在 Gemini API 更新日志中发布 Gemini 3.1 Flash-Lite Preview,是 Gemini 3 系列首个 Flash-Lite 模型。模型页面提供规格、具体更新和开发者指引。
Together AI 推出全新品牌视觉形象,新形象由设计机构 Pentagram 参与打造,围绕其连接开源创新、系统研究与开发者体验的生态理念展开。Together AI 定位为 AI Native Cloud,提供从预训练到推理的全流程支持,Cursor 和 Decagon 等 AI 原生公司已在其平台上构建产品。
Factory 将于 3 月 9 日在伦敦开设新办公室,作为服务欧洲客户的中心。该办公室正在招聘 GTM 与运营岗位,涵盖销售、客户成功、市场、运营、部署工程和解决方案工程。
平面设计师 Ruth Heasman 借助 Replit Agent,在 Replit 移动端 Buildathon 中一周内做出 AR 捉鬼游戏 Spookseek AR,并已提交 TestFlight 公测。
Replit 介绍其视频渲染引擎:向页面注入约 1200 行脚本,替换 setTimeout、requestAnimationFrame、Date.now 等时间 API,让浏览器按 1000/fps 毫秒逐帧推进,从而把任意 URL 的动画确定性导出为 MP4。
Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。
推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。
Replit 推出新 Pro 计划,定价 $100/月,提供 Turbo Mode、$100 到 $4,000/月的分级积分、15 名协作者、优先支持和 28 天数据恢复。
推荐理由:原文给出了两档订阅的价格、功能和 Agent 模式差异,可帮读者按团队规模和用量判断选哪档。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Together AI 推出 SF Streets 和 US Streets 两个语音识别基准,测试显示 15 个先进 ASR 模型对街名的平均转写错误率为 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% 对 64%)。
非技术背景的 SaaS 设计师 Dan Kempe 借助 Replit Agent、Expo 和 Replit 新移动工具,在移动 Buildathon 期间独立开发出速读新闻 iOS 应用 Flash News,上线后下载量接近 300 次。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Gemini API 发布 Gemini 3.1 Pro Preview,这是 Gemini 3 系列的最新迭代版本。同时上线独立端点 gemini-3.1-pro-preview-customtools,更擅长优先调用自定义工具,适合同时使用 bash 和工具的开发者。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
Replit 推出与 Databricks Apps 和 Databricks AppKit 的集成,企业用户可在 Replit 中构建应用后部署到 Databricks,继承其治理、安全与可观测性能力。该集成支持从 AppKit 模板起步、团队实时协作,并用 Replit 的 AI 工作流按 AppKit 模式生成代码。目前开放早期访问申请,现有 Replit 客户可通过客户团队获取预览权限。
Gemini API 宣布 gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 和 gemini-2.0-flash-lite-001 四款模型将于 2026 年 6 月 1 日关停。开发者需在此日期前迁移至其他模型。
Gemini API 于 2 月 17 日关停三款预览模型:gemini-2.5-flash-preview-09-25、imagen-4.0-generate-preview-06-06 和 imagen-4.0-ultra-generate-preview-06-06。上述模型已停止服务,开发者需迁移至其他可用版本。
千问团队正式发布 Qwen3.5 系列,并开源该系列首个模型 Qwen3.5-397B-A17B 的权重。该模型是原生视觉语言模型,官方称其在推理、编码、智能体能力和多模态理解的全套基准评测中表现突出,面向开发者和企业开放使用。
推荐理由:官方宣布 Qwen3.5 系列首个开源权重模型发布,覆盖推理、编码、智能体和多模态评测,适合关注开源多模态模型进展的读者。
SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。
MiniMax 发布内部 RL 框架 Forge,通过中间件解耦架构、Windowed FIFO 调度、前缀树合并和 CISPO 算法解决 Agent RL 的吞吐、稳定性与灵活性冲突。该框架在 MiniMax M2.5 训练中接入超过 10 万种真实 Agent 脚手架与环境,上下文长度达 200k,日吞吐量达百万级样本;前缀树合并带来 40x 训练加速。
Replit 与 Snowflake 联合 webinar 第二部分演示如何把 Snowflake 数据看板升级为可用的数据工具:通过 Replit Agent 用自然语言提示词加入未来 15 天收入预测、下钻分析和 Slack 阈值告警,并嵌入可回答自然语言问题、同时展示所执行 SQL 的 AI 数据助手。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或容量波动时保持 Agent 行为一致。
一篇发表于 Lawfare 研究论文系列的文章指出,先进 AI 默认不会帮消费者以更低成本获得理想法律结果,因为监管壁垒、对抗性动态和人类参与这三重瓶颈仍待解决。文章以 GPT-4 通过律师资格考试为背景,指出即便生产力提升、单项法律任务成本下降,诉讼双方仍会陷入工作量军备竞赛,总成本居高不下。
MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。
Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。
千问(Qwen)团队发布下一代图像生成基础模型 Qwen-Image-2.0。核心亮点包括专业排版渲染,支持 1k token 指令直接生成 PPT、海报、漫画等专业信息图;更强的语义遵从能力,原生支持 2K 分辨率生成精细写实场景。
推荐理由:原文列出了排版渲染和语义遵从两项核心能力,可帮助读者判断其在信息图和写实场景上的适用性。
PromptArmor 发布研究,指出消息应用(如 Telegram、Slack)的链接预览会在无需用户点击的情况下自动请求 URL,间接提示词注入可诱导 AI 智能体在回复中返回携带用户敏感数据的恶意链接,从而在预览时即完成数据外泄。
推荐理由:原文给出完整的链接预览数据外泄攻击链和可复现测试,读者可据此自查所用智能体是否暴露风险。
OpenClaw 宣布与 VirusTotal 合作,为 ClawHub 技能市场提供安全扫描,所有已发布技能都将经 VirusTotal 威胁情报和由 Gemini 驱动的 Code Insight 分析。
Sierra 创始人 Bret Taylor 与 Clay Bavor 发布第二年度复盘,公司继七个季度达成 1 亿美元 ARR 后迎来首个 5000 万美元季度,进入第三年时 ARR 超过 1.5 亿美元。
Suno 为 Premier 订阅者的 Suno Studio 推出 1.2 版本,新增 Remove FX 可去除音频片段效果并导出无效果版本至 DAW,Warp Markers 支持配合 Quantize 调整音频时序与律动。该版本还引入 Alternates 优化 take lanes 试听流程,并支持 4/4 以外的拍号,如 6/8、7/8 和 11/4。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元,较一年前增长超过三倍,累计融资达 7.81 亿美元。本轮融资由 Sequoia Capital 领投,Andrew Reed 加入董事会,A16Z 加注四倍、ICONIQ 加注三倍。
推荐理由:官方公告给出了融资金额、估值、ARR 和资金用途,读者可以据此了解 ElevenLabs 在语音智能体上的投入方向。
Qwen 团队发布开源权重模型 Qwen3-Coder-Next,专为编码智能体和本地开发设计。模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力加 MoE 的新架构,通过大规模可执行任务合成、环境交互和强化学习进行 agentic 训练。
推荐理由:原文说明该模型面向编码智能体与本地开发,并给出混合注意力加 MoE 的架构与训练方式,读者可据此评估其定位。
ElevenLabs 宣布其最先进的 Text to Speech 模型 Eleven v3 结束 Alpha,正式全面可用。测试中新版本相较 Alpha 被 72% 的用户偏好;基于覆盖 8 种语言 27 个类别的内部基准,错误率从 15.3% 降至 4.9%,下降 68%,显著改进了数字、符号和专用记号(如电话号码、货币、化学式、比分)的读法。模型现已在所有平台开放。
推荐理由:官方给出了语音模型稳定性与符号读法准确率的具体数据,可据此判断其在多语言场景的可用性。
Replit 推出 Snowflake 连接器,让用户通过自然语言提示词 vibe code 自定义数据应用,无需手写代码。该连接器提供对 Snowflake 数据库的安全只读访问,免去复杂认证与配置,支持 plan 和 build 两种模式迭代仪表盘与报告。应用发布只需数分钟,内置安全扫描、认证与部署功能,可设为私有、密码保护或公开。
Arvind Narayanan 在其新文章和视频中逐条考证 Moravec 悖论(对人类难的任务对 AI 容易、反之亦然),指出它从未被实证检验,本质是 AI 社区认为值得研究的问题造成的筛选效应,其演化解释也很可疑。
ElevenLabs 与 Audi Revolut F1 Team 达成合作,将用 AI 音频与语音生成技术为车队打造跨文化、可规模化的数字内容。Audi Revolut F1 Team 首席商务官 Stefano Battiston 称 ElevenLabs 是 AI 语音技术领域的领导者,双方将探索赛道内外的新内容形式与车迷互动方式。