已关闭
[RFC]: Qwen3-235B MoE Model veRL GRPO/DAPO Training Support #2
kkodoo创建于 2025年11月3日关闭于 2025年11月25日
2025年11月3日 修改了issue 的描述
2025年11月14日 关联了pull request:[feat] Qwen3-235B MoE Model veRL GRPO/DAPO Training Support
2025年11月22日 修改了issue 的描述
2025年11月25日 关闭了 issue
3月20日 添加了label:resolved


1. 支持目标
1.1 部署方式
支持Qwen3-235B MoE模型在Atlas A3环境上的veRL长序列训练(输入2K+输出32K),在NPU上实现高吞吐性能,支持以下部署方式:
1.2 优化特性
2. 具体优化特性
2.1 推理阶段使能TorchAir GE图模式
TorchAir将FX计算图转换为昇腾中间表示,即Ascend IR计算图,并通过GE(Graph Engine,图引擎)实现计算图的编译、优化和执行。为了获得最优执行性能,GE提供了计算图优化、多流并行、内存复用等技术手段。支持推理阶段使能GE图模型,在大batchsize场景下提升推理吞吐。
2.2 推理负载均衡优化
为了解决RL训练中长尾请求导致的“木桶效应”,设计实现一套在vLLM推理引擎内的动态负载均衡调度方案,通过实时感知并迁移任务,协同多档位编图,提升长序列场景下全局推理效率和资源利用率。
2.3 通信优化
2.4 FA算子负载均衡
传统Attention受限于显存占用高、高频访问HBM、计算效率低等瓶颈,FA算子通过分块+重计算+算子融合使能高效计算。通过使能FA算子负载均衡,提高Vector Core资源利用率,减少Attention计算时间,提升整体吞吐。
2.5 开发事项