AI 导读
阿易 AI Notes 给出了复现 125B 模型加 25 万上下文方案的核心参数,包括支持 Qwen-Next 架构的 llama.cpp 实验分支编译命令和 llama-server 启动命令。
正文
想复现 125B + 25 万上下文方案的兄弟,核心编译与运行参数自取:
💻 1. llama.cpp 实验分支编译(支持 Qwen-Next 架构):
git clone https://t.co/lWchFAK2sy && cd llama.cpp
git fetch origin pull/27742/head:qwen-next && git checkout qwen-next
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=native -DBUILD_SHARED_LIBS=OFF
cmake --build build --config Release -j $(nproc) --target llama-server
🚀 2. 极限拉满 25 万上下文启动命令:
./build/bin/llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 250000 --port 8080 -v --fit off -b 4096 -ub 4096 -cmoe
模型权重为 4 分卷 GGUF(约 111.4GB),Hugging Face 搜索 Qwen3.8-Flash-Next 即可。
GLM 5.3 Flash 和 Qwen 3.8 Flash Next,本周你们觉得谁才是真正的端侧开源之王?
来源:@AYi_AInotes · x.com