华为昇腾宣布已支持 RL 训推一致性,Qwen3-30B MoE 实测 Logdiff 为 0、最高 60% 性能收益
华为昇腾宣布已支持 RL 训推一致性,实测获得最高 60% 性能收益
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
华为昇腾基于 Ascend C 编程语言提供完整训推一致算子集,在 Qwen3-30B MoE 模型上实现 Logdiff 为 0,并通过 FA 算子优化在 Eager 模式下获得 20%-60% 性能收益。相关基础设施已开源,还将上线“训推一致问题识别 Skill”,用于排查残余 logdiff 并定位算子路径或框架实现差异。
来源:IT Home · ithome.com