跳到正文
@Yuchenj_UW· @Yuchenj_UW · X·· 2026-08-22AI 评分58
AI 导读

UC Berkeley 开源了推理引擎 FreeToken,公布的结果是单张 RTX PRO 6000 可运行 753B 的 GLM-5.2,速度 14.9 tok/s。8GB 显存、约 1000 美元的 RTX 4060 笔记本可运行 Qwen3.6-35B,速度 39.3 tok/s。作者称 FreeToken 在消费级 GPU 上比 Ollama 快 2–4 倍,并致谢 @Andy_ShuoYang 和 UC Berkeley Sky Lab。

正文

UC Berkeley open-sourced FreeToken. Wild results:

A single RTX PRO 6000 runs the 753B GLM-5.2 at 14.9 tok/s!

An 8GB RTX 4060 laptop (~$1,000) runs Qwen3.6-35B at 39.3 tok/s!

FreeToken is 2–4x faster than Ollama across consumer GPUs. Local AI inference is getting very real. Great work by @Andy_ShuoYang and UC Berkeley Sky Lab!

来源:@Yuchenj_UW · x.com