SuperInfer:面向 LLM 推理的 SLO 感知旋转调度与内存管理
SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SuperInfer 是一套面向 LLM 推理的 SLO 感知调度与内存管理方案,结合旋转调度(rotary scheduling)与内存管理来优化推理服务。该工作以 SLO 为约束目标,针对 LLM 推理场景设计调度策略。原文未披露具体模型、参数规模或性能数字。
来源:supercomputing-system-ai-lab.github.io(经 Hacker News) · supercomputing-system-ai-lab.github.io