在 Tenstorrent 硬件上运行大型语言模型:深入解析 vLLM TT 插件
在Tenstorrent硬件上运行大型语言模型:深入解析vLLM TT插件
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
vLLM 发布 TT 插件,用于在 Tenstorrent 硬件上服务大语言模型。该插件将 vLLM 的推理服务能力接入 Tenstorrent 加速器,具体性能数据与支持模型范围尚未披露。
来源:vllm.ai(经 Hacker News) · vllm.ai
在Tenstorrent硬件上运行大型语言模型:深入解析vLLM TT插件
本站未展示全文,请前往来源网站阅读。
vLLM 发布 TT 插件,用于在 Tenstorrent 硬件上服务大语言模型。该插件将 vLLM 的推理服务能力接入 Tenstorrent 加速器,具体性能数据与支持模型范围尚未披露。
来源:vllm.ai(经 Hacker News) · vllm.ai