已关闭
[RFC]: Qwen3-235B MoE Model veRL GRPO/DAPO Training Support #2
kkodoo创建于  2025年11月3日关闭于  2025年11月25日
kkodoo
kkodoo
2025年11月3日 创建

1. 支持目标

1.1 部署方式

支持Qwen3-235B MoE模型在Atlas A3环境上的veRL长序列训练(输入2K+输出32K),在NPU上实现高吞吐性能,支持以下部署方式:

  • 训练阶段采用 TP+PP+CP+EP (Tensor Parallel,TP;Pipeline Parallel,PP;Context Parallel,CP;Expert Parallel;EP)部署方式;
  • 推理采用Attention部分 DP+TP 部署,MoE部分大EP部署;
  • 使用全共卡部署,推理引擎采用 vLLM+vLLM-Ascend,训练引擎采用 Megatron+MindSpeed。

1.2 优化特性

  • 支持Qwen3-235B MoE模型在veRL训练过程中使能图模式等特性和高性能融合算子;
  • 支持数据均衡和推理阶段开启动态感知的负载均衡;
  • 支持vLLM框架通信优化和RL推理调度优化;
  • 支持FA算子负载均衡。

2. 具体优化特性

2.1 推理阶段使能TorchAir GE图模式

TorchAir将FX计算图转换为昇腾中间表示,即Ascend IR计算图,并通过GE(Graph Engine,图引擎)实现计算图的编译、优化和执行。为了获得最优执行性能,GE提供了计算图优化、多流并行、内存复用等技术手段。支持推理阶段使能GE图模型,在大batchsize场景下提升推理吞吐。

2.2 推理负载均衡优化

为了解决RL训练中长尾请求导致的“木桶效应”,设计实现一套在vLLM推理引擎内的动态负载均衡调度方案,通过实时感知并迁移任务,协同多档位编图,提升长序列场景下全局推理效率和资源利用率。

2.3 通信优化

  • 针对vLLM框架侧通信优化,将基于Gloo后端的CPU侧通信替换为HCCL后端的NPU侧通信;
  • 采用Decode阶段零冗余TP转EP通信方案,减少通信量并消除冗余算子。

2.4 FA算子负载均衡

传统Attention受限于显存占用高、高频访问HBM、计算效率低等瓶颈,FA算子通过分块+重计算+算子融合使能高效计算。通过使能FA算子负载均衡,提高Vector Core资源利用率,减少Attention计算时间,提升整体吞吐。

2.5 开发事项

likedislike
张张德鹏成员
2025年11月3日 将 caojingyi 设为负责人
kkodookkodoo
2025年11月3日 修改了issue 的描述
张德鹏成员
2025年11月3日 评论:

预计11月底完成性能优化和发布,敬请期待!

likedislike
张张德鹏成员
2025年11月3日 关联了里程碑:Release plan Nov. 2025
kkodookkodoo
2025年11月14日 关联了pull request:[feat] Qwen3-235B MoE Model veRL GRPO/DAPO Training Support
kkodookkodoo
2025年11月22日 修改了issue 的描述
CANN-robotCANN-robot成员
2025年11月25日 关闭了 issue
CANN-robotCANN-robot成员
3月20日 添加了label:resolved