已关闭
[Requirement|需求建议]: A2/A3支持MegaMoE大通算融合算子 #2111
dingxu创建于 4月27日关闭于 6月5日
huang-chuhong
4月27日 评论:
4月27日 评论:
你好,这个我们需要commiter评估下,这边会及时跟进commiter意见


4月28日 关联了看板:Transformer
6月4日 关联了pull request:mega moe def change
此处折叠了39条事件消息 查看更多
28 天前 关联了pull request:mega_moe相关问题修复同步到9.2.0-beta1
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
Backgroud(背景信息)
最近deepseek v4发布了关于Cuda显卡下的对MoE模块的大通算融合算子MegaMoE的支持,其包含了从“permute-all2all-GMM-Swiglu_GMM-all2all-unpermute”等全链路的算子融合支持,大幅提升整网性能;针对NPU A3场景,vllm-ascend也开源了类似的算子dispatch_ffn_combine。
CANN仓需要支持MeaMoE大算子来对标Cuda场景,同时,针对A2单机、多机场景也需要开发新的MegaMoE-A2算子,包括浮点和量化版本
Benefit / Necessity (价值/作用)
MoE模块的耗时占比较高(包括计算和通信占比),因此在Cuda已有大融合算子的前提下,必须开发A2/A3芯片下的CANN大融合算子,以保持CANN的推理性能竞争力。
Design(设计方案)
1)A3场景可复用vllm-ascend开源的dispatch_ffn_combine算子,仅做一些仓库间的迁移即可
2)A2单机HCCS链路的fullmesh场景,也可复用A3当前方案,仅需针对平台差异化配置项(如平台型号与芯片版本获取接口、HCCL 通信参数封装结构体定义等),以及HCCL 缓存缓冲区的使用逻辑进行少量适配修改
3)A2多机场景,机内HCCS,机间RDMA,不同于A3远端读的方案,A2需要采用远端写的方案;同时,参考dispatch算子实现分层通信的优化手段