跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

当前仅显示精选新闻
574条精选相关主题产品更新论文研究开源生态

最新精选

第 161–180 条 · 共 574 条
9月2日周三
  1. @kimmonismus65

    Anthropic 的 Claude Fable 5.1 输入/输出价格维持 $10/$50 每百万 token,缓存读取下降 75% 至 $0.25,Anthropic 估计典型工作负载成本约降 25%、高智能体且重上下文的任务最高约 45%,但仅适用于按 token 计费的使用,订阅不会便宜 45%。

    推荐理由:文中并列给出 Fable 5.1 的定价、缓存成本与多项智能体基准变化,便于对比升级前后的取舍。

  2. @testingcatalog71

    Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,并称其面向编码与知识工作。据 Testing Catalog 引述,Fable 5.1 在 Terminal-Bench-Science 0.1 上得分 52.6%,是 Fable 5 的两倍多;在 Terminal-Bench 4.0 上得分 55.8%,Fable 5 为 42.0%。两款模型目前正在 Claude 上推送。

    引用@claudeai@claudeai

    We’re introducing Claude Fable 5.1 and Claude Mythos 5.1. They're the world’s most advanced models for coding and knowledge work. https://t.co/8P9PSrWPi3

    推荐理由:两款新模型在 Terminal-Bench 系列基准上的分数对比,可直观看出相对前代的提升幅度与推送状态。

  3. Gemini API 更新日志62

    Gemini 3.8 Flash 正式发布 GA 版本

    Google 发布 gemini-3.8-flash 正式版(GA),称其为此前最智能的 Flash 模型。该模型面向长程软件工程、自主智能体和企业复杂工作流,可通过 Gemini API 模型页面和最新模型指南上手。

    推荐理由:官方宣布 gemini-3.8-flash 转正为 GA 版本,定位长程软件工程与智能体场景,可据此评估是否替换现有 Flash 调用。

9月1日周二
  1. @TencentHunyuan72

    腾讯混元称 Hy4 preview 在 AI 研究中自行发现推理瓶颈,通过算子融合与通信优化把端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型此前以 770B 总参数、49B 激活参数、1M 上下文发布,主打生产力与开源前沿,并给出博客、HuggingFace 和 GitHub 入口。

    引用@TencentHunyuan@TencentHunyuan

    🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr

    推荐理由:官方给出模型自主定位推理瓶颈并完成优化的具体数字,可供观察自我优化在推理侧的落地方式。

  2. Runway News68

    Runway 发布 Interface World Model 首个模型 Solaris,实时生成可交互界面

    Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。

    推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。

  3. Claude Platform release notes71

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,默认 1M token 上下文并下调缓存读取价格

    Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。

    推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。

8月30日周日
  1. @AYi_AInotes68

    腾讯混元发布 Hy4 preview,770B 总参数、49B 激活参数、1M 上下文,面向生产力场景并开源,官方称保持可负担的一致定价。官方同时给出博客、HuggingFace 和 GitHub 入口,并邀请用户反馈问题。转发该消息的博主称 Hy4 已进入 Arena 代码榜全球第 5。

    原始视频预览图;未保存可播放视频URL
    引用@TencentHunyuan@TencentHunyuan

    🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr

    推荐理由:混元 Hy4 preview 以 770B 参数和 1M 上下文开源,Arena 代码榜排名给出编码能力的横向参照。

8月29日周六
  1. AGI Hunt · 微信公众号77

    腾讯发布混元 Hy4 preview:770B 参数、1M 上下文并开源权重

    腾讯发布混元 Hy4 preview,总参数 770B、激活 49B,支持 1M tokens 上下文,权重与 FP8 版本已在 HuggingFace、GitHub、ModelScope、GitCode 开源,采用 Apache 2.0 协议。

    推荐理由:作者用游戏开发、PPT 制作和云账单分析等多场景实测,展示 Hy4 preview 的能力边界与同代模型对照。

8月28日周五
  1. SiliconFlow73

    智谱(Zai)开源 GLM-5.3,SiliconFlow 提供 Day-0 支持,模型已可在其平台使用。该模型总计 744B / 激活 40B,与 GLM-5.2 基座相同,主要靠后训练进一步提升智能,官方称在编程和智能体基准上可与 Fable 5 和 GPT-5.6 Sol 竞争。SiliconFlow 称其在 OpenRouter 上 GLM-5.2 token 份额排名第一。

    推荐理由:原文给出参数规模、与 GLM-5.2 的关系及基准表现,读者可据此评估是否切换到 GLM-5.3。

  2. @OpenRouter76

    GLM-5.3 现已开放权重,并上线 OpenRouter,具备 1M 上下文和可配置的推理力度。该模型由 @Zai_org 发布,面向复杂软件工程、长程智能体和网络安全场景。Zai 称这是其在智能体编程与网络防御方面能力最强的模型,权重可供下载、运行和定制。

    引用@Zai_org@Zai_org

    GLM-5.3 is now open-weight. Our most capable model for agentic coding and cyber defense is now available to download, run, and customize. Weights: https://t.co/v1IbWMXxg4 Tech blog: https://t.co/ekQkO83jCv https://t.co/f8XlJksKyf

    推荐理由:GLM-5.3 以开源权重上线托管平台,1M 上下文与可调推理力度可供开发者直接接入评估。

  3. @kimmonismus71

    GLM-5.3 已在 Hugging Face 正式上线,作者列出了在本地运行该模型的硬件门槛。FP8 需 10–12× H100 或 8× H200;4-bit/NVFP4 约 390–430GB,可用一台 512GB Mac Studio 或 4× DGX Spark;激进 2-bit 约 230–250GB,一台 256GB Mac Studio 或 2× DGX Spark,但有质量和上下文方面的权衡。首批 GGUF 和 NVFP4 量化已开始出现。

    引用@kimmonismus@kimmonismus

    Quick reminder: in 4 hours you will be able to download and run sota AI. If you have enough compute ofc. What a time to be alive. https://t.co/T6bs1VnVG1

    推荐理由:GLM-5.3 上线后给出了各量化档位的显存与硬件门槛,可供本地部署选型参考。

  4. AGI Hunt · 微信公众号79

    阿里千问开源 Qwen3.8-Flash-Next,6B 激活在 9 项基准中 8 项超过 Opus 4.6 Max

    阿里千问于 8 月 26 日晚开源 Qwen3.8-Flash-Next 权重,生产版 Qwen3.8-Flash 同步上线千问 AI 平台 API,官方称这套 Next 架构是 Qwen4 系列的雏形。

    推荐理由:作者在 Qoder 中实测了这款每 token 仅激活 6B 的 MoE 模型,并拆解其稀疏注意力与外挂 N-gram 表的设计取舍。

  5. @kimmonismus66

    腾讯发布开源模型 Hy4 Preview,770B 参数、49B 激活参数、1M token 上下文窗口。腾讯称 Hy4 可并行协调多个 Codex 会话、评估其输出并调整研究方向,在八个基准上超过 Codex 单独工作,目标场景是长程编码、多文件办公任务与科学研究。作者认为这是一次扎实的发布,放在几个月前属于绝对的 sota。

    原始视频预览图;未保存可播放视频URL原始视频预览图;未保存可播放视频URL
    引用@TencentHunyuan@TencentHunyuan

    🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr

    推荐理由:腾讯开源 770B 参数模型并给出并行调度多个 Codex 会话的智能体研究能力,可对照其八个基准结果判断定位。