Netflix 详述其基于 Triton 与 vLLM 的内部 LLM 服务平台
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Netflix 披露其内部 LLM 推理服务平台的生产经验,该平台基于现有 JVM 服务层构建,小模型在 CPU 进程内运行,大请求交由 MSS 处理,由 Triton 负责模型加载、批处理与 GPU 调度,vLLM 负责执行推理。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com
本站未展示全文,请前往来源网站阅读。
Netflix 披露其内部 LLM 推理服务平台的生产经验,该平台基于现有 JVM 服务层构建,小模型在 CPU 进程内运行,大请求交由 MSS 处理,由 Triton 负责模型加载、批处理与 GPU 调度,vLLM 负责执行推理。
来源:AI前线 · 微信公众号 · mp.weixin.qq.com