跳到正文
原文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-26精选AI 评分76
AI 导读

Qwen 团队开源 Qwen3.8-Flash,总参数 125B 加 51B N-gram 嵌入,每 token 仅激活 6B,训练成本为 Qwen3.7-Plus 的 1/9。

推荐理由

Qwen3.8-Flash 以 125B 总参数、6B 激活和 1/9 训练成本给出开源 MoE 的效率样本,可对照其基准数据看架构取舍。

正文

Damn,125B 总参数,每 token 只激活 6B,训练成本砍到上一代的 1/9,SWE-bench Pro 62.5 超过 Claude Opus 4.6 Max 的 53.4。
Qwen 团队今天这波操作真是让我目瞪口呆,,
这根本不是什么 3.8 小更新啊,
简直就是把 Qwen4 的核心架构提前开源出来掀桌了啊,

整篇报告看完,数据简直炸裂:
总参数 125B 加上 51B 嵌入,但每个 token 实际只激活区区 6B 参数,
训练成本直接砍到上一代的九分之一,
但在 SWE-bench Pro 的编程基准里拿下 62.5,正面反超了 Claude 的旗舰模型

通义这次可以说是把大模型的架构刀法彻底改写了:

他们用类似大脑记忆的方式,平时压缩记忆,需要时才做精准检索,
1M 超长上下文的吞吐直接暴涨了 8 倍多

最绝的是加了 51B 的常用词字典,直接放在内存里查表,
几乎不占 GPU 算力,就白白吃下了巨大的模型容量

这根本不是常规的堆算力,而是智能密度和系统效率的全面革命,
故意在全量 Qwen4 发布前把架构权重开源,
就是让开源社区、vLLM 和量化生态先把底座铺满,
再加上输入 1 块钱输出 3 块钱每百万 token 的定价值,完全是要把 Agent 应用的门槛直接打穿le

以前大家总觉得模型越大越好,
现在通义用一台极速跑车告诉你,架构做对了,用极低的成本一样能跑出顶级的智能

属于架构效率狂欢的时代,真被通义给踢开大门了啊

引用@Alibaba_Qwen@Alibaba_Qwen
⚡Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight! The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens. 125B parameters + 51B N-gram embeddings, with just 6B activated per token. Unmatched cost-efficiency. What's new: 🥳 - Next architecture: GDN + QSA hybrid attention, Gated Residual, N-gram Embedding & Muon optimizer, serving as a precursor to the architecture used in Qwen4. - Dramatically lower training and inference costs: trained at just 1/9 the cost of Qwen3.7-Plus, while outperforming it across the board with especially strong gains in coding and office tasks. - Strong performance: scoring 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro, 73.9 on CoWorkBench, 84.5 on AndroidWorld, and 95.7 on MathVision (with CI). - 262K native context, extensible to 1M with YaRN. We’re also releasing the weights for Qwen3.8-Flash-Next, giving the community an early look at the new architecture we’re exploring for Qwen4.🚀 We can't wait to see what you build with Qwen3.8-Flash!👀👇 - Blog: https://t.co/M5hYypFLgJ - Technical Report: https://t.co/IF0gObIkQO - Hugging Face: https://t.co/6ow8QVAABt - ModelScope: https://t.co/tDOn2jNuFG
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com