伯克利与 MIT 开源推理引擎 FreeToken,RTX 4060 上 35B 模型达每秒 39 Token
RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
加州大学伯克利分校和麻省理工学院的研究人员推出开源推理引擎 FreeToken,目标是让前沿 MoE 模型跑在消费级硬件上。论文基准显示,8GB 显存的 RTX 4060 笔记本运行 Qwen3.6-35B 约为每秒 39 个 Token,相同 MoE 模型下解码比 Ollama 和 llama.cpp 快 3~4 倍、预填充快 6~30 倍。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com