跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

当前仅显示精选新闻
574条精选相关主题产品更新论文研究开源生态

最新精选

第 281–300 条 · 共 574 条
8月13日周四
  1. Microsoft AI News66

    Microsoft AI 发布推理模型 MAI-Thinking-1

    Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。

    推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。

  2. Gemini API 更新日志65

    Gemini 3.7 Flash 正式发布 GA

    Google 在 Gemini API 更新日志中宣布 Gemini 3.7 Flash(gemini-3.7-flash)正式可用(GA),定位为面向编码和 Agent 的主力模型。官方称其在软件工程、Web 开发和智能体工作流上有大幅改进,2026年12月31日前提供入门价。

    推荐理由:官方说明点名软件工程与智能体工作流的改进,并给出了到2026年底的入门价格窗口。

  3. DeepSeek API updates84

    DeepSeek-V4-Pro 正式版上线,Agent 能力提升并支持 Responses API

    DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。

    推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。

8月12日周三
  1. IT Home78

    SpaceXAI 发布 Grok 4.6 模型,强化长流程智能体任务

    Grok 4.6 正式发布,在 Grok 4.5 基础上进一步强化长时间运行的智能体任务,以及复杂的交互和视觉工作。在综合 9 项基准的 Artificial Analysis Intelligence Index 上,Grok 4.6 与 GPT-5.6 Sol 取得相同成绩,并已在 Cursor 和 Grok Build 上线。

    推荐理由:Grok 4.6 强化长流程智能体任务,在 9 项基准综合指数上与 GPT-5.6 Sol 同分。

  2. Google DeepMind71

    Google DeepMind 发布手语转文本模型 SL2T,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL

    Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。

    推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。

  3. Cursor Blog68

    Cursor 与 SpaceXAI 发布 Grok 4.6,面向长时间运行的智能体

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,该模型基于 Grok 4.5 打造,重点面向长时间运行的智能体以及更复杂的交互与视觉工作。它在由九项基准测试构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。

    推荐理由:Grok 4.6 与 GPT-5.6 Sol 在综合智能指数上持平,文中给出了与 Grok 4.5 及 GPT-5.6 Sol 的多项基准对比。

  4. LMSYS Blog65

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。

    推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。

8月11日周二
  1. 量子位 · 微信公众号78

    Meta 开源 30B 本地 Agent 模型 Muse Glimmer,24GB 显存可运行

    Meta MSL 开源本地 Agent 模型 Muse Glimmer,总参数约 296 亿(含约 18 亿参数视觉编码器),上下文超 13 万 Token,支持文本和图像输入,量化到 17GB 后可装进 24GB 消费级显存。

    推荐理由:Meta 开源 30B 级本地 Agent 模型,量化后 24GB 消费级显存可跑,读者可据此判断本地 Agent 的部署门槛变化。

8月10日周一
  1. Hugging Face Blog81

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。

    推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。

8月6日周四
8月5日周三
  1. ByteDance Seed Research68

    字节 Seed 发布音视频全双工大模型 SeedRealtime 并在豆包 App 全量上线

    ByteDance Seed 发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持音视频联合理解、主动交互与流畅对话节奏。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。模型已在豆包 App 全量上线,用户更新后在对话框选择“打电话”进入视频通话即可体验。

    推荐理由:原文给出统一架构、端到端评测数字和豆包 App 开放入口,可据此了解音视频全双工交互的能力与体验变化。

8月4日周二
  1. Mistral AI64

    Mistral AI 开源 3B 多模态安全分类器 Shieldstral

    Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。

    推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。

8月3日周一
  1. AI前线 · 微信公众号78

    阿里正式发布 Qwen3.8,2.4T 规模,自主编程 16 天做出 Hermes Agent 级框架

    阿里巴巴正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,支持视觉理解,上下文长度达 1M Tokens。

    推荐理由:原文给出 2.4T MoE 旗舰模型的参数规模、编程能力表现和 API 定价,便于比较其性价比定位。

  2. Qwen Blog67

    Qwen 发布 Qwen3.8-Max,将首次开源 Max 级模型权重

    Qwen 官方发布 Qwen3.8-Max,称为 Qwen 家族迄今最强模型,参数规模达 2.4 万亿,基于 Qwen3.5 架构,在编码、办公和研究等方面全面提升。官方还将首次开源 Qwen-Max 级模型权重,开放权重定于下周发布。

    推荐理由:Qwen 官方宣布新旗舰模型并开源 Max 级权重,读者可据此关注其编码与协作能力变化。

8月1日周六
  1. AI寒武纪 · 微信公众号86

    OpenAI 确认下一代模型 Astra 存在,约 2000 美元算力解出十项数学前沿难题

    OpenAI 官宣下一代模型 Astra 的存在,并公布其在数学与理论计算机科学领域完成的十项突破,这些问题此前至少十年未有解法,在 Sol API 费率下总算力成本约 2000 美元。

    推荐理由:OpenAI 公开下一代模型 Astra 攻克的十项数学难题,并给出 Lean 形式化验证与解题过程,可观察模型参与前沿研究的实际方式。

7月31日周五
  1. DeepSeek68

    DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 正式开启公测,Agent 能力大幅升级,基准成绩远超 V4-Pro-Preview。官方版本原生支持 Responses API 格式并完整适配 Codex,配置详情见官方文档 https://api-docs.deepseek.com/quick_start/agent_integrations/codex。

    推荐理由:官方宣布 V4-Flash 公测上线,Agent 能力大幅升级并原生支持 Responses API,配有与多款模型的基准对比数据。