跳到正文
@berryxia· @berryxia · X·· 2026-05-27AI 评分37
AI 导读

MiniMax AI 工程负责人 Skyler Miao 预告“Something BIG is coming”,配图透露 MiniMax M3 采用基于 GQA 的动态块稀疏注意力:先用轻量索引分支扫完整上下文选出最相关 token 块,再仅对这些块做稀疏注意力。在 1M token 上下文下,Prefill 速度比 M2 快 9.7 倍,解码速度快 15.6 倍。

正文

兄弟们,MiniMax M3 要来了~~~

MiniMax AI工程负责人Skyler Miao今天只发了一句“Something BIG is coming”。

配图里藏着M3模型的核心架构:基于GQA的动态块稀疏注意力。

它先用一个轻量索引分支快速扫完整上下文,选出最相关的token块,再只对这些块做真正的Sparse Attention(稀疏注意力)。

结果在1M token上下文上,Prefill (预填充)速度比M2快9.7倍,解码速度快15.6倍。

以前大家卷长上下文,算力成本像天文数字。现在MiniMax直接把这个天花板砸出一个口子,让百万token级别的Agent任务真正能落地。

长上下文不再是“能跑就行”,而是开始变得又快又省。

MiniMax M3一旦发布,DeepSeek V4之外,又多了一个能把1M上下文真正玩转的选手。

引用Skyler Miao (@SkylerMiao7)@SkylerMiao7
Something BIG is coming
在 X 查看被引用的帖子

来源:@berryxia · x.com