Mistral 发布开源 Lean 4 证明智能体 Leanstral
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,采用 120B-A6B 稀疏架构,并可通过 Mistral Vibe 和 labs-leanstral-2603 API 端点使用。
媒体报道、公司博客与研究文章
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,采用 120B-A6B 稀疏架构,并可通过 Mistral Vibe 和 labs-leanstral-2603 API 端点使用。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展,包括接入 NVIDIA Dynamo 1.0 推理栈、通过 NVIDIA NemoClaw 提供 OpenShell 运行时,并在模型库上线 NVIDIA Nemotron 3 Super 与 Parakeet TDT 0.6B V3。
Gemini API 于 3 月 16 日推出重新设计的 Usage Tiers 和 Billing Account 支出上限,以改善用户的计费体验。
Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。
推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。
伯克利 AI 研究提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。
Linear 发布视觉界面改版,通过调暗导航侧边栏、压缩顶部标签、减少图标使用并软化边框对比,让主内容区更突出。改版借助内置 dev toolbar 一键切换 feature flags 对比新旧版本,并用 Claude Code 在数小时内构建出可调 hue、chroma、lightness 的颜色工具,其 token 值以 JSON 导入 Figma。
对话式 AI 平台 Sierra 宣布在西班牙马德里开设办公室,并已与多家西班牙大型企业合作构建 AI 客户体验。Sierra 智能体可覆盖产品推荐、注册、账户管理、故障排查、忠诚度计划与流失管理等场景;英国零售商 Next 六周上线,覆盖 83 个国家 48 种语言,Cigna 八周投产并将患者认证时间缩短 80%,Singtel 十周上线,解决率超 70%。
Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。
推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。
Microsoft 推出 Copilot Health,这是 Copilot 内的独立安全空间,可整合健康记录、可穿戴设备数据与健康历史并生成个性化健康洞察。
推荐理由:官方宣布 Copilot Health 上线并给出数据整合规模、隐私隔离措施和分阶段开放方式,读者可以了解其功能边界与使用入口。
Google 推出 Groundsource 方法,利用 Gemini 从 80 种语言的新闻报道中提取并验证历史洪水事件,构建覆盖 150 多个国家、2000 年至今的 260 万条记录数据集并开放获取。
Runway 发文说明其本周发布的实时视频智能体 API Runway Characters 的安全考量,该产品基于 World Model GWM-1,可从单张图像生成可对话的定制角色。
Together AI 发布面向实时语音智能体的统一解决方案,将 STT、LLM 和 TTS 共置在同一集群内,用户语音结束到首个音频 token 的端到端延迟低于 500ms。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。
推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。
Gemini API 为 AI Studio 的计费引入项目级支出上限(project-level spend caps),用于限制单个项目的花费。该功能于 2026 年 3 月 12 日上线。
Manus 发布首封年度信并推出 Manus 2.0,CEO Red 回顾了 Manus 从"AI 不仅应思考、更应行动"的构想出发,一年内已能构建含数据库和 AI 原生功能的全栈 Web 应用乃至移动应用。信中提出下一步目标:让不懂编程的人也能使用,并让 Agent 全天候 24/7 持续运行。
Runway 宣布成立内部孵化器 Runway Labs,专注探索生成式视频与 General World Models 的下一代应用。该孵化器由联合创始人兼首席创新官 Alejandro Matamala Ortiz 领导,负责孵化处于 AI 视频前沿的实验性产品。Runway 同时启动招聘,招募设计、ML、全栈及 AI 工程师与创业者。
Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。
推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。
Together AI 在 Day 0 通过 Dedicated Inference 上线 NVIDIA Nemotron 3 Super,这是一款 120B 参数(12B 激活)的混合模型,结合 Transformer 与 Mamba 架构,支持 1M token 上下文窗口。
SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。
推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。
Microsoft AI 分析 2026 年 1 月超过 50 万条 Copilot 健康与 wellbeing 相关对话,发现近 1/5 对话涉及用户描述自身症状、解读检查结果或管理病情,约 40% 的问题聚焦症状、疾病和治疗信息。
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复等企业级能力。
Gemini 发布首个多模态嵌入模型 gemini-embedding-2-preview,支持文本、图像、视频、音频和 PDF 输入,并将所有模态映射到统一的嵌入空间。同时,gemini-2.5-flash-lite-preview-09-2025 将于 2026 年 3 月 31 日关停。
作者将Squarespace Blueprint AI、Wix AI、Shopify、Manus、Framer、10Web、Hostinger AI、Durable和Webflow放在三个相同的电商场景中评测AI实际生成的网站质量。
Gemini 3 Pro Preview 模型已被关停,原 gemini-3-pro-preview 现指向 gemini-3.1-pro-preview。
Manus 博客用同一严格提示测试了 8 个 AI 作品集构建工具,按设计质量、AI 智能化程度和发布能力评分排名。Manus 和 Replit 均为 9/10,Aura、Figma、Webflow 为 8/10,Lovable、Wix 为 7/10,Jimdo 为 6/10。
推荐理由:作者用同一提示实测 8 个 AI 作品集构建工具,从设计、AI 智能化和发布能力逐项对比,读者可按预算和风格对号入座。
Manus 用同一个 Solace Studio 健康工作室应用提示,实测 Manus、Lovable、Base44、Replit、Bubble、Figma App Builder 和 Glide 七个平台。结论是 Manus 综合最佳,几乎从单一提示交付支付、取消政策和预订逻辑等完整堆栈;Lovable 原型最精美,Replit 最适合开发者,多数平台仍主要生成前端,后端逻辑需手动补齐。
推荐理由:同一提示实测七款工具,指出多数平台只生成前端而支付与预订逻辑才是分水岭,结论可用于选型参考。
Manus 博客用同一段 8 分钟原始素材对十款 AI 视频剪辑工具做统一工作流评测,涵盖 Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip、Filmora 与 Manus 自身,价格截至 2026 年 3 月。
Together AI 团队发布 FlashAttention-4,通过算法与内核协同设计最大化 Blackwell GPU 上矩阵乘与其他资源瓶颈的重叠。在 B200 BF16 上达到最高 1605 TFLOPs/s(71% 利用率),前向比 cuDNN 9.13 快最高 1.3 倍、比 Triton 快最高 2.7 倍。
Together 在首届 AI Native Conf 发布七项研究与产品,覆盖内核、强化学习和算法推理优化三大方向。
Together AI 提出缓存感知的 prefill–decode 分离架构 CPD,在标准 PD 基础上新增 pre-prefill 节点层和三级 KV-cache 层级(GPU 显存、主机 DRAM、RDMA 分布式缓存),将低复用率的冷请求与高复用率的暖请求分流到不同计算资源。
Google 在 Gemini API 更新日志中发布 Gemini 3.1 Flash-Lite Preview,是 Gemini 3 系列首个 Flash-Lite 模型。模型页面提供规格、具体更新和开发者指引。
Together AI 推出全新品牌视觉形象,新形象由设计机构 Pentagram 参与打造,围绕其连接开源创新、系统研究与开发者体验的生态理念展开。Together AI 定位为 AI Native Cloud,提供从预训练到推理的全流程支持,Cursor 和 Decagon 等 AI 原生公司已在其平台上构建产品。
Google Gemini API 发布 Nano Banana 2,即 Gemini 3.1 Flash Image Preview,定位为面向速度和高并发场景的高效模型。同时官方宣布 gemini-3-pro-preview 将于 2026 年 3 月 9 日停用。
推荐理由:官方更新日志同时给出新模型定位和旧模型下线日期,读者可以据此安排 Gemini API 的模型切换。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Together AI 推出 SF Streets 和 US Streets 两个语音识别基准,测试显示 15 个先进 ASR 模型对街名的平均转写错误率为 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% 对 64%)。
SGLang 团队与 NVIDIA 合作宣布,在 SemiAnalysis InferenceXv2 基准上,SGLang 运行 DeepSeek R1 在 GB300 NVL72 上相比 H200 实现最高 25x 性能提升,同时不到 4 个月内将 GB200 NVL72 上的性能提升最高 8x。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力掩码与三项联合训练目标,让扩散语言模型在减少采样步数的同时支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Gemini API 发布 Gemini 3.1 Pro Preview,这是 Gemini 3 系列的最新迭代版本。同时上线独立端点 gemini-3.1-pro-preview-customtools,更擅长优先调用自定义工具,适合同时使用 bash 和工具的开发者。
SGLang 在 GB300 NVL72 上部署 DeepSeek R1-NVFP4,128K/8K 长上下文场景下实现 226.2 TPS/GPU,较 GB200 提升 1.53X;相同吞吐下 MTP 使用户吞吐再提升 1.87X。
Gemini API 宣布 gemini-2.0-flash、gemini-2.0-flash-001、gemini-2.0-flash-lite 和 gemini-2.0-flash-lite-001 四款模型将于 2026 年 6 月 1 日关停。开发者需在此日期前迁移至其他模型。