跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 2026-08-27AI 评分50
AI 导读

一位海外开发者在 Ubuntu 上用单张 24G RTX 4090 加 110G DDR4 内存,通过 llama.cpp 最新分支的 -cmoe 参数跑起 125B 的 Qwen 3.8 Flash Next,预填充约每秒 364 个 token、解码约每秒 21 个 token,上下文拉到 250,000。

正文

本地大模型的显存壁垒,今天被正式宣告物理终结了,
单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了,
而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词

以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群,

但这次海外极客在 Ubuntu 上用一张普通 4090 加 110G 白菜价 DDR4 内存,

硬生生跑出了生产级的速度:
预填充每秒 364 词,解码每秒 21 词,
最狠的是没开 MTP、没开 dflash,连 KV 缓存都没做任何量化

很多人好奇 24G 显存怎么塞得下 125B 还带 25 万上下文,
核心全靠 llama.cpp 最新分支里一个叫 -cmoe 的物理外挂:

它把 512 个专家层全部扔给廉价的系统内存,
把最吃计算的注意力机制留在 4090 显存里,
显存占用瞬间从 24G 暴跌到 11.6G,而且解码速度几乎毫无损耗

空出来的整整 12G 显存,全被拿去放上下文,
直接把窗口一路顶到了 250,000 的绝对上限,跑完甚至还剩 5 个多 G 的显存余量

再加上把 batch 设到 4096,提示词处理速度直接翻倍狂飙,
以前大家觉得消费级显卡只能跑跑 7B 到 27B 的小模型,
现在 MoE 架构加上内存卸载,直接把数据中心级别的智能焊死在了家用电脑里

本地折腾私有大模型和超长 Agent 的时代,
真的被这套组合拳给彻底砸开大门了啊 https://t.co/6oStmPfact

来源:@AYi_AInotes · x.com