Mistral AI 发布 Pixtral 12B 多模态模型
Mistral AI 发布 Pixtral 12B 原生多模态模型,基于 Mistral Nemo 12B,采用 Apache 2.0 许可,支持可变图像尺寸与宽高比,并可在 128k token 上下文内处理任意数量图片。
推荐理由:Pixtral 12B 以 Apache 2.0 开源并支持 128k 多图输入,MMMU 得分 52.5%,读者可据此比较小尺寸多模态模型的取舍。
媒体报道、公司博客与研究文章
Mistral AI 发布 Pixtral 12B 原生多模态模型,基于 Mistral Nemo 12B,采用 Apache 2.0 许可,支持可变图像尺寸与宽高比,并可在 128k token 上下文内处理任意数量图片。
推荐理由:Pixtral 12B 以 Apache 2.0 开源并支持 128k 多图输入,MMMU 得分 52.5%,读者可据此比较小尺寸多模态模型的取舍。
Mistral AI 宣布 Le Chat 更名为 Vibe,工作与代码场景统一为一个智能体和一套许可,原有对话、设置与方案全部保留。
Mistral AI 发布非生产许可 MNPL,允许开发者将模型用于非商业用途并支持研究工作,Codestral 也在该许可下发布。Mistral 表示会继续以 Apache 2.0 发布模型和代码,并将逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 用新许可划出商用与非商用的边界,开发者可据此判断使用其模型的合规范围。
Mistral AI 发布其首个区域语言模型 Mistral Saba,24B 参数,基于从中东和南亚精选的数据集训练,支持阿拉伯语和多种印度语系语言,在泰米尔语等南印度语系上表现尤为突出。
Mistral 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最多 128k token 上下文,基座与指令微调权重均以 Apache 2.0 许可开源。
推荐理由:Mistral NeMo 以 Apache 2.0 开源并支持 128k 上下文,读者可借基准表判断它与同尺寸开源模型的位置。
Mistral AI 发布新一代旗舰文本生成模型 Mistral Large,可通过 la Plateforme 和 Azure 使用,具备 32K token 上下文窗口与原生函数调用能力。
推荐理由:官方给出与 GPT-4 的基准位次和 Azure 上线渠道,读者可据此了解这款欧洲旗舰模型的定位。
Mistral AI 发布新的内容审核 API,即支撑 Le Chat 审核服务的同一套接口,现已开放给用户按自身应用和安全标准调用。模型是一个 LLM 分类器,将文本输入划分为 9 个类别,原生支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Mistral 发布 Codestral Mamba,这是一个基于 Mamba 架构的 7B 指令代码模型,权重已在 HuggingFace 开放,采用 Apache 2.0 许可。
推荐理由:Mamba 架构带来线性时间推理与长序列建模,官方还测试了 256k token 的上下文检索,为代码助手的本地部署提供 Transformer 之外的选择。
Mistral AI 发布 Codestral 25.01,采用更高效的架构和改进的 tokenizer,生成与补全代码的速度约为上一版 2 倍,在 FIM 任务上达到 SOTA。新模型上下文长度为 256k,HumanEval 得分 86.6%,已在 IDE 及插件合作方推出,可通过 la Plateforme 的 codestral-latest 调用,并支持本地或 VPC 部署。
Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。
推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。
Mistral AI 发布专注 STEM 的数学推理模型 Mathstral 7B,基于 Mistral 7B,在 MATH 上得分 56.6%、MMLU 上得分 63.47%。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的稀疏混合专家(SMoE)开放权重模型,总参数 46.7B,每个 token 只激活 12.9B 参数。
推荐理由:官方给出与 Llama 2 70B、GPT-3.5 的逐项基准对比,可据此判断稀疏 MoE 开放权重的性价比。
Mistral AI 发布首个代码模型 Codestral,这是一个 22B 开放权重模型,支持 80 多种编程语言、32k 上下文窗口,并通过 fill-in-the-middle 机制补全代码、编写测试。
推荐理由:22B 开放权重代码模型给出 32k 上下文与多语言基准对照,可据此判断自部署代码补全的取舍。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,配备 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图片。
推荐理由:官方在同一测试框架下给出与 GPT-4o、Gemini-1.5 Pro 的多模态基准对比,可据此看开放权重模型的当前位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,称其在全部评测上超过 Llama 2 13B,多项基准接近 Llama 1 34B。该模型采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在 16k 序列长度、4k 窗口下推理提速 2x,并能在 8192 序列长度下节省一半缓存。
推荐理由:官方给出与 Llama 2 系列同评估管线的对比和 Apache 2.0 授权,便于判断同尺寸模型的选型空间。
Mistral 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向优先考虑数据量而非同步响应的场景,用户上传批处理文件后下载输出结果,适用于客户反馈与情感分析、批量文档摘要与翻译、向量嵌入和搜索索引构建、数据标注等。
Google Cloud API Gateway 新增模型路由功能,进入 Public Preview,开发者可在 OpenAPI 3.x 规范中把虚拟模型名映射到共享主机上的具体后端,动态将流量路由至 Gemini、Claude 或 OpenAI OSS-GPT,无需硬编码端点或自建开源代理。
工程师为在 Ironwood TPU 上部署 397B 参数的 Qwen 3.5 MoE 模型,构建了模块化 JAX/Pallas 优化栈,使 prefill 密集型负载的推理速度最高提升 4.7 倍。
Gemini Enterprise Agent Platform 的智能体与模型评估服务现已正式可用,为开发者提供统一引擎,在本地开发实验与线上生产流量中一致衡量智能体质量。
推荐理由:评估服务正式可用并给出 20 多项指标与接入入口,读者可据此判断智能体评测如何融入现有开发流程。
Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为网页接地(grounding)提供商原生集成到 Gemini Enterprise Agent Platform,让开发者用可验证的实时网页结果锚定 AI 智能体,提升复杂企业工作流的事实准确性。该合作还支持以编程方式提取、永久缓存并处理网页数据,并可与其他大语言模型配合使用。
Google 推出 JAX 原生后训练库 Tunix,用于消除训练多轮、工具调用型 LLM 推理智能体时的 TPU 闲置瓶颈。它通过高并发异步 rollout 与解耦的生产者-消费者流水线提升硬件吞吐,让训练器在智能体等待网络 I/O 或环境步骤时仍持续获得数据。Tunix 还提供即插即用抽象与持续的宏观层面 profiling,便于接入自定义开源环境并优化分布式工作流。
LiteRT 与轻量级 Gemma 开源模型组合,可在树莓派上部署安全、实时的边缘 AI。LiteRT 优化 CPU 与 GPU 性能,为 Gemma4 等模型带来快速 token 速度,支持机器人实时本地推理。开发者可用轻量级 LiteRT CLI 工具快速转换、量化并运行这些模型,对 Hailo AI 加速器的支持也即将推出。
Google 开源 TPU 微基准测试套件,可从 Network、Compute、HBM、Host Transfer 和 Attention 五个组件提供细粒度性能指标,用于验证真实硬件能力。借助这些基准建立 Roofline 模型,工程师能判断机器学习负载受限于计算、内存还是网络,并据此开展 kernel 调优、mesh 分片和重计算等针对性优化,提升大规模模型部署的硬件利用率。
实时 AI 智能体依赖长连接、有状态的双向流,使传统请求-响应式负载均衡无法反映服务器真实容量。开发者需在运行时内实现应用层会话追踪,准确统计活跃对话的并发负载,并将精确会话数与 CPU 利用率一并输入混合路由算法,从而有效分发有状态 AI 流量,避免单个后端成为瓶颈。
Google 开发者专家在 Google I/O 后利用 Antigravity 和 Gemini 构建了一款 AI 赛车教练,用于弥合领域差距。该工具的具体参数、性能数据及可用性尚未披露。
MCP 2026-07-28 规范用完全无状态核心取代旧有有状态约束,支持云原生横向扩展、serverless 部署和标准轮询负载均衡。该架构引入标准化 HTTP 头以便在无需深度包检测的情况下路由,并加入缓存控制与 Multi Round-Trip Requests(MRTR)来处理交互式和长时间运行任务。
Genkit Go 引入基于渐进式披露架构的 Agent Skills,开发者可将专用指令、脚本和参考资料打包成模块化 SKILL.md 技能包,初始仅向智能体系统提示词暴露 frontmatter 元数据。当任务匹配技能描述时,Genkit 中间件动态加载完整指令正文与相关资源,从而避免上下文窗口膨胀并降低 token 消耗。
Conductor 从 Gemini CLI 扩展升级为可移植插件,将对话式规格驱动开发(SDD)带入 Antigravity CLI 和 Claude 等生态。开发者无需依赖严格命令序列,可自然对话,由 AI 助手在后台动态管理 spec.md、plan.md 等持久化 markdown 产物。该更新消除了工作流摩擦,并让仓库成为跨 AI 工具、受版本控制的项目架构与状态唯一来源。
Ray 2.55 引入对 Google Cloud TPU 的官方一级支持,开发者可用熟悉的 Ray task 与 actor API 在 TPU 上运行分布式 Python 工作负载。
Ray 的高层库 Serve、Data 和 Train 可简化在 Google TPU 切片上运行 AI 工作负载。Ray Serve 通过简单的拓扑配置对大型多主机模型进行正确的成组调度,Ray Data 以原生 JAX batch 直接向加速器供数,消除数据加载瓶颈。JaxTrainer 则自动处理跨切片协调、checkpoint 与容错,简化 TPU 上的分布式训练。
Agent Plugins 1.0.0 是一项厂商中立的目录规范,由 Google、Amazon、Microsoft 等支持,可将 Agent Skills 与 MCP server 打包成单一可移植单元。
推荐理由:规范统一了 Agent Skills 与 MCP server 的打包方式,读者可据此判断跨 IDE 兼容的成本。
Google Research 回顾了 2020 年发布的十余项研究,涵盖用 Transformer 做大规模图像识别、MediaPipe Holistic 在设备端同时预测人脸手部与姿态、以及用于 NLP 模型交互分析的语言可解释性工具 LIT。其他工作还包括用 AutoML 做时间序列预测、用 GAN 生成奇幻生物、MinDiff 框架缓解 ML 模型偏见,以及大语言模型的隐私考量。
Google Research 发布 Diffusion Controller,用于统一并简化 AI 图像生成流程。同期还推出零样本多变量预测基础模型 TimesFM-3,以及面向连续血糖监测的基础模型 GlucoFM。此外,ToolGrad 实现用文本"梯度"高效生成工具使用数据集,AgentHands 则为 XR 中智能体对话生成交互式手势。
Google Research 汇总其声音与声学方向的研究,涵盖用鸟类数据训练的 AI 揭示水下谜题、听觉智能新基准、声源定位提升群组对话可访问性,以及零样本单声道转双耳语音合成。相关成果还涉及 AI 识别鲸类发声、对比式神经音频分离、SoundStorm 并行音频生成、AudioLM 音频生成语言建模和 TRILLsson 通用语音表征。
Google Research 的 Software Systems & Engineering 栏目汇总了多项研究,包括从联邦数据中实现可证明隐私的学习、用 Regression Language Models 模拟大型系统,以及借助 Google AI Edge 的 MediaPipe 在浏览器中运行 7B+ 语言模型。
Google Research 回顾了 2016 年发布的多项成果,包括 12 月 15 日上线的 Motion Stills、12 月 7 日开源的 Embedding Projector 高维数据可视化工具,以及 11 月 22 日展示零样本翻译的多语言神经机器翻译系统。
Google Research 公布其 Networking 研究领域,归属于"应用 AI 与科学、基础 ML 与算法、人/系统与量子 AI"三大方向之下。该页面同时强调构建协作生态、共同塑造未来,并将发现转化为现实影响。
Google Research 发布 2012 年度内容汇总,涵盖语音识别中的大规模语言建模、Ngram Viewer 2.0 以及开源重排序框架 ReFr。同期还记录了 WINE 2012 研讨会、EMEA Faculty Summit 2012 与 CS4HS 等学术和教育项目。
Google Research 发布 TimesFM-3,一个面向多变量预测的零样本基础模型。同期还推出面向表格数据的零样本基础模型 TabFM,以及 Gemini Enterprise Agent Platform 的 Agentic RAG 能力。
Google Research 的 RAI-HCT Highlights 汇总了其负责任 AI 系列文章,涵盖 2023 年 3 月至 2024 年 1 月发布的多篇内容。主题包括生成式 AI 安全的对抗测试、AI 研究中的上下文(CAIR)、感知公平性、社会背景知识、AI for Social Good、PAIR、技术与社会文化以及 Impact Lab。