跳到正文
AI前线 · 微信公众号·· 24 天前AI 评分69

伯克利与 MIT 开源推理引擎 FreeToken,RTX 4060 上 35B 模型达每秒 39 Token

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

加州大学伯克利分校和麻省理工学院的研究人员推出开源推理引擎 FreeToken,目标是让前沿 MoE 模型跑在消费级硬件上。论文基准显示,8GB 显存的 RTX 4060 笔记本运行 Qwen3.6-35B 约为每秒 39 个 Token,相同 MoE 模型下解码比 Ollama 和 llama.cpp 快 3~4 倍、预填充快 6~30 倍。

来源:AI前线 · 微信公众号 · mp.weixin.qq.com