MarkTechPost· Asif Razzaq·· 2026-08-23精选AI 评分77
FreeToken:单张工作站 GPU 运行 753B GLM-5.2 的边缘 MoE 推理引擎
Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU
AI 导读
UC Berkeley 与 UT Austin 研究团队提出边缘原生 MoE 推理引擎 FreeToken,把个人机器当作统一弹性推理平台,可在单张工作站 GPU 上运行 753B 的 GLM-5.2。
推荐理由
文中给出多档消费级与工作站 GPU 的实测吞吐和缓存命中率,可作本地 Agent 推理的选型参考。
来源:MarkTechPost · marktechpost.com