SGL-Diffusion 中 AR+DiT 的全栈性能优化:SRT 后端、动态批处理与异构并行
Full-Stack Performance Optimization of AR+DiT in SGL-Diffusion
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SGL-Diffusion 团队通过三个递进 PR 优化 AR+DiT 混合生成管线:用 SRT 替换 HF 后端将 AR 阶段解耦为独立服务,单卡 AR 耗时从 122.8s 降至 46.6s(−62.1%),4-NPU 异构配置(AR 用 TP=4、DiT 用 SP=4)下端到端延迟从 154.6s 降至 35.2s(−77.2%)。
来源:LMSYS Blog · lmsys.org