Nitsum:用自适应张量并行服务分层 LLM 请求
Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Nitsum 提出用自适应张量并行来服务分层 LLM 请求,针对不同层级的请求动态调整张量并行策略。该方案面向 LLM 推理服务场景,试图在分层请求负载下优化资源分配。原文未披露具体模型、参数规模或性能数字。
来源:mlsys.wuklab.io(经 Hacker News) · mlsys.wuklab.io