跳到正文
LMSYS Blog· Ascend Team·· 2026-08-05AI 评分44

SGL-Diffusion 中 AR+DiT 的全栈性能优化:SRT 后端、动态批处理与异构并行

Full-Stack Performance Optimization of AR+DiT in SGL-Diffusion

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SGL-Diffusion 团队通过三个递进 PR 优化 AR+DiT 混合生成管线:用 SRT 替换 HF 后端将 AR 阶段解耦为独立服务,单卡 AR 耗时从 122.8s 降至 46.6s(−62.1%),4-NPU 异构配置(AR 用 TP=4、DiT 用 SP=4)下端到端延迟从 154.6s 降至 35.2s(−77.2%)。

来源:LMSYS Blog · lmsys.org