全部AI 动态
全部动态
今日 26 条
SiliconFlow@SiliconFlowAIAI 评分3434
SiliconFlow@SiliconFlowAI精选AI 评分7373
推荐理由:原文给出参数规模、与 GLM-5.2 的关系及基准表现,读者可据此评估是否切换到 GLM-5.3。
Z.ai@Zai_org精选AI 评分7070
推荐理由:官方宣布权重开放并给出下载与博客入口,读者可以据此评估 GLM-5.3 在智能体编码场景的可用性。
Z.ai@Zai_orgAI 评分4545更多好消息:GLM-5.3 的权重将于明天发布。 https://huggingface.co/zai-org/GLM-5.3
Google AI Developers@googleaidevsAI 评分4747
Z.ai@Zai_org精选AI 评分7272
推荐理由:官方公告同时给出价格定位、开源权重和芯片适配信息,读者可以据此评估它在现有工作流中的替换可能。
LMSYS Blog精选AI 评分7272 SGLang 为 Qwen3.8-Flash-Next 提供 Day-0 支持
SGLang 团队与 Qwen、NVIDIA、AMD 合作,为 Qwen 团队开源的多模态 MoE 模型 Qwen3.8-Flash-Next 提供 day-0 支持。
推荐理由:原文详解了 SGLang 对 Qwen3.8-Flash-Next 的 day-0 支持与架构实现细节,含量化检查点和实测吞吐数据,对部署选型有参考价值。
Hugging Face Blog精选AI 评分6363 IBM 发布 Granite 4.2 推理模型家族并详解构建过程
IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。
推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。
DeepSeek@deepseek_aiAI 评分6060
Hugging Face Blog精选AI 评分6565 Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。
推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。
DeepSeek API updates精选AI 评分7070 DeepSeek 发布实验版多模态模型 DeepSeek-V4-Flash-Vision-Exp
DeepSeek 在 API 平台上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,通过设置 model='deepseek-v4-flash-vision-exp' 即可调用。
推荐理由:官方公布了多模态 Agent 基准成绩和调用方式,读者可据此判断其视觉 Agent 能力在现有模型中的位置。
Microsoft ResearchAI 评分5050 微软 Skala 1.1 发布:训练数据增 2.5 倍,并集成进 CP2K 等主流 DFT 软件
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
@thexpin@thexpin精选AI 评分6868 推荐理由:原文交代了 GLM-5.3 的能力侧重、基准分数和开放节奏,读者可以据此判断其在开源与闭源模型中的位置。
Z.ai@Zai_orgAI 评分5656
Microsoft AI NewsAI 评分5353 Microsoft 发布 MAI-Cyber-1-Flash 安全模型并推出 agentic 安全系统 Perception
Microsoft 发布首个 cyber 模型 MAI-Cyber-1-Flash,为源自 MAI-Thinking-1 的紧凑代码安全模型,可处理约 90% 的任务,让 MDASH 把 GPT-5.4 留给最难的 10% 任务,相比现有最佳组合节省 50% 成本。
Ammaar Reshi@ammaar精选AI 评分6868
推荐理由:原文给出 Gemini 3.7 Flash 的降价幅度和三项能力改进方向,并列出可用渠道,读者可快速了解这版更新。
Google DeepMind精选AI 评分7272 Google DeepMind 发布 Gemini 3.7 Flash,聚焦编码与 Agent 能力
Google DeepMind 发布 Gemini 3.7 Flash,定位为迄今最智能的编码与 Agent 主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方给出了具体基准数字与限时定价,开发者可据此评估是否把编码和 Agent 工作流迁移到新模型。
Microsoft AI News精选AI 评分6666 Microsoft AI 发布推理模型 MAI-Thinking-1
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
DeepSeek API updates精选AI 评分8484 DeepSeek-V4-Pro 正式版上线,Agent 能力提升并支持 Responses API
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 上线,模型名 deepseek-v4-pro,API 调用方式不变。官方称 Agent 能力大幅提升,生产环境性能表现提升尤为显著,并公布 HLE (wo / w tools) 42.7/60.0、Terminal Bench 2.1 87.9、NL2Repo 61.5 等基准成绩。
推荐理由:官方公告列出了正式版在多项 Agent 与编码基准上的分数、Responses API 支持和峰谷定价细节,方便用户评估迁移与调用时机。
Google DeepMind精选AI 评分7171 Google DeepMind 发布手语转文本模型 SL2T,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL
Google DeepMind 发布多语言手语转文本(SL2T)模型,首次将手语 AI 用于消费产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持 ASL 转英文,后续将扩展更多语言和设备。
推荐理由:官方介绍 SL2T 的技术路径、训练数据和实测限制,读者可以了解手语翻译从实验到消费产品的落地方式。
Cursor Blog精选AI 评分7373 Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时间运行的智能体任务
Cursor 与 SpaceXAI 发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、复杂交互和视觉工作。
推荐理由:官方发布说明了训练方法与多项智能体编程基准成绩,读者可据此对比 Grok 4.5 与 GPT-5.6 Sol 的表现。
Google Research精选AI 评分6666 Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
Microsoft AI NewsAI 评分5454 Microsoft 发布 MAI-Code-1.1-Flash:代码质量更高、速度更快,价格仅为 1.0 的四分之一
Microsoft 发布 MAI-Code-1.1-Flash,代码质量更高、token 效率提升 25%,价格仅为 6 月在 Microsoft Build 发布的 1.0 的四分之一,并已在 GitHub Copilot 投入生产。
Microsoft AI NewsAI 评分5959 Microsoft 发布 MAI-Image-2.6,Arena 文生图榜位列第二
Microsoft 发布 MAI-Image-2.6,在 Arena 文生图排行榜上排名第二,领先 Meta、Google 和 xAI 的模型。该模型总体 Elo 比 MAI-Image-2.5 提升 +79,文本渲染单项提升 +91 Elo,各评测类别均有进步。目前可在 Arena 上试用,本周晚些时候上线 MAI Playground,并将很快登陆 Microsoft Foundry 等产品。
Hugging Face Blog精选AI 评分8181 Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景
Meta 发布从 Muse 蒸馏而来的 30B 多模态模型 Muse Glimmer,采用 Apache 2.0 许可,面向本地隐私场景的智能体用途。模型由 2B ViT 视觉编码器和 28B 文本解码器组成,支持图像、视频、多模态工具调用和目标检测,并附带基于 DFlash 的可选投机解码。
推荐理由:原文给出架构组成、基准对比和各推理框架的 day-0 用法,读者可以据此评估本地部署的可行路径。
Claude Platform release notes精选AI 评分6262 Claude Sonnet 5 维持 $2/$10 per MTok 定价,取消原定 9 月涨价
Anthropic 宣布 Claude Sonnet 5 的入门定价 $2/$10 per MTok 转为标准定价,原定 2026 年 9 月 1 日上调至 $3/$15 per MTok 的计划不再执行。
推荐理由:官方确认原定涨价取消,使用 Claude Sonnet 5 的读者可据此保持成本预算和用量规划不变。
Google DeepMind精选AI 评分8383 Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文显示精度领先一天
Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。
推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。
Mistral AI精选AI 评分6464 Mistral AI 开源 3B 多模态安全分类器 Shieldstral
Mistral AI 发布开源多模态安全分类器 Shieldstral,权重 3B,采用 Apache 2.0 协议。模型将内容审核改写为推理时的问答任务,用户用自然语言给出政策,无需重训即可适配文本、图像和 prompt–response 对的审核。
推荐理由:原文解释了用问答式策略接口替代固定分类体系的设计思路,并给出训练数据构建方法,读者可以借鉴其小模型超越大模型的数据策略。
Nathan Lambert: InterconnectsAI 评分5151 开源模型盘点第23期:Laguna S2.1、Inkling 与 Kimi K3 展现开源模型在 Pareto 前沿的价值
本期开源模型盘点收录 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE)、Tencent Hy3(295B-A21B。
DeepSeek API updates精选AI 评分6666 DeepSeek-V4-Flash 正式版 API 上线,Agent 基准远超 V4-Pro-Preview
DeepSeek-V4-Flash 正式版 API 上线公测,调用方式不变,模型名设为 deepseek-v4-flash 即可使用。
推荐理由:官方给出完整的 Agent 基准分数和调用方式,读者可以直接评估是否切换到 deepseek-v4-flash 正式版。
Google DeepMind精选AI 评分6767 Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。
推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。
Microsoft AI News精选AI 评分6161 Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制
Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。
推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。
Microsoft AI News精选AI 评分6161 Microsoft 发布面向 GitHub Copilot 和 Excel 的专用 MAI 模型
微软宣布 MAI 模型落地 GitHub Copilot 和 Excel,通过 hill-climbing 方法从 MAI-Code-1-Flash 出发训练出更高效的专用模型。
推荐理由:微软用自家产品数据展示小模型在 Copilot 和 Excel 的效率与成本对比,读者可据此评估专用小模型替代大模型的路径。
Microsoft AI News精选AI 评分6262 Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览版
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Claude Platform release notes精选AI 评分8383 Anthropic 发布 Claude Opus 5,支持 1M token 上下文窗口
Anthropic 发布 Claude Opus 5(claude-opus-5),较 Claude Opus 4.8 有显著提升,支持 1M token 上下文窗口、128k 最大输出 token,默认开启 thinking,定价维持 $5/$25 美元每 MTok。
推荐理由:官方发布说明给出完整规格、定价与破坏性变更,开发者可直接据此评估迁移方案。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%。
推荐理由:官方博客给出三款 Flash 模型的 token 效率、价格和多项基准数据,可帮助开发者评估选型与 agent 成本。
Google DeepMind精选AI 评分6666 Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于更快地发现、验证和修补漏洞。
推荐理由:原文给出基准对比、内部落地和受限开放方式,读者可以据此评估轻量安全模型在漏洞发现中的取舍。
Hugging Face Blog精选AI 评分8181 Hugging Face 发布 Thinking Machines 多模态开源模型 Inkling 使用指南并推出 Inkling-Small
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
Mistral AIAI 评分5555 Mistral AI 发布 Robostral Navigate:8B 具身导航模型,单 RGB 相机在 R2R-CE 达 76.6%
Mistral AI 发布首个具身导航模型 Robostral Navigate,8B 参数,仅用单个普通 RGB 相机和自然语言指令即可让机器人在复杂环境中自主导航,在 R2R-CE validation unseen 达到 76.6% 成功率,领先最佳单相机方案 9.7 分、领先使用深度或多相机方案 4.5 分。