最新精选 第 281–300 条 · 共 574 条 00:00 Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
00:00 Google 在 Gemini API 更新日志中宣布 Gemini 3.7 Flash(gemini-3.7-flash)正式可用(GA),定位为面向编码和 Agent 的主力模型。官方称其在软件工程、Web 开发和智能体工作流上有大幅改进,2026年12月31日前提供入门价。
推荐理由:官方说明点名软件工程与智能体工作流的改进,并给出了到2026年底的入门价格窗口。
00:00 DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。
推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。
23:57 Grok 4.6 正式发布,在 Grok 4.5 基础上进一步强化长时间运行的智能体任务,以及复杂的交互和视觉工作。在综合 9 项基准的 Artificial Analysis Intelligence Index 上,Grok 4.6 与 GPT-5.6 Sol 取得相同成绩,并已在 Cursor 和 Grok Build 上线。
推荐理由:Grok 4.6 强化长流程智能体任务,在 9 项基准综合指数上与 GPT-5.6 Sol 同分。
22:01 Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。
推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。
08:00 Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。
08:00 Cursor 与 SpaceXAI 联合发布 Grok 4.6,该模型基于 Grok 4.5 打造,重点面向长时间运行的智能体以及更复杂的交互与视觉工作。它在由九项基准测试构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。
推荐理由:Grok 4.6 与 GPT-5.6 Sol 在综合智能指数上持平,文中给出了与 Grok 4.5 及 GPT-5.6 Sol 的多项基准对比。
00:00 SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。
推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。
17:08 Meta MSL 开源本地 Agent 模型 Muse Glimmer,总参数约 296 亿(含约 18 亿参数视觉编码器),上下文超 13 万 Token,支持文本和图像输入,量化到 17GB 后可装进 24GB 消费级显存。
推荐理由:Meta 开源 30B 级本地 Agent 模型,量化后 24GB 消费级显存可跑,读者可据此判断本地 Agent 的部署门槛变化。
08:00 Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
21:00 NVIDIA 发布 Cosmos 3 开放世界物理 AI 基础模型系列,基于 mixture-of-transformers 架构,融合视觉推理、世界生成与动作预测能力。
推荐理由:原文列出 Cosmos 3 三个尺寸的定位与多项基准排名,读者可据此判断开放世界模型在物理 AI 中的分工。
09:30 阿里巴巴 8 月 3 日正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4T、激活 95B,支持视觉理解与 1M Tokens 上下文。
推荐理由:原文列出 2.4T 总参数、激活 95B 与 API 定价,读者可据此比较旗舰模型的规模与成本取舍。
00:00 ByteDance Seed 发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本,支持音视频联合理解、主动交互与流畅对话节奏。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半。模型已在豆包 App 全量上线,用户更新后在对话框选择“打电话”进入视频通话即可体验。
推荐理由:原文给出统一架构、端到端评测数字和豆包 App 开放入口,可据此了解音视频全双工交互的能力与体验变化。
21:58 Liquid AI 发布 LFM2.5-2.6B,一款可完全在设备端运行的智能体模型,支持工具调用与多步工作流,预训练约 34T tokens,中期训练将上下文窗口扩展至 128K。
推荐理由:官方给出与约 4 倍参数量模型的逐项基准对比和 CPU 解码速度,可供判断端侧智能体的可用边界。
20:00 Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
12:24 阿里巴巴正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,支持视觉理解,上下文长度达 1M Tokens。
推荐理由:原文给出 2.4T MoE 旗舰模型的参数规模、编程能力表现和 API 定价,便于比较其性价比定位。
10:00 Qwen 官方发布 Qwen3.8-Max,称为 Qwen 家族迄今最强模型,参数规模达 2.4 万亿,基于 Qwen3.5 架构,在编码、办公和研究等方面全面提升。官方还将首次开源 Qwen-Max 级模型权重,开放权重定于下周发布。
推荐理由:Qwen 官方宣布新旗舰模型并开源 Max 级权重,读者可据此关注其编码与协作能力变化。
17:52 OpenAI 官宣下一代模型 Astra 的存在,并公布其在数学与理论计算机科学领域完成的十项突破,这些问题此前至少十年未有解法,在 Sol API 费率下总算力成本约 2000 美元。
推荐理由:OpenAI 公开下一代模型 Astra 攻克的十项数学难题,并给出 Lean 形式化验证与解题过程,可观察模型参与前沿研究的实际方式。
上一页 1 … 13 14 15 16 17 … 29 下一页