已关闭
[Requirement|需求建议]: A2/A3支持MegaMoE大通算融合算子 #2111
dingxu创建于  4月27日关闭于  6月5日
dingxu
4月27日 创建

Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.

Backgroud(背景信息)

最近deepseek v4发布了关于Cuda显卡下的对MoE模块的大通算融合算子MegaMoE的支持,其包含了从“permute-all2all-GMM-Swiglu_GMM-all2all-unpermute”等全链路的算子融合支持,大幅提升整网性能;针对NPU A3场景,vllm-ascend也开源了类似的算子dispatch_ffn_combine。

CANN仓需要支持MeaMoE大算子来对标Cuda场景,同时,针对A2单机、多机场景也需要开发新的MegaMoE-A2算子,包括浮点和量化版本

Benefit / Necessity (价值/作用)

MoE模块的耗时占比较高(包括计算和通信占比),因此在Cuda已有大融合算子的前提下,必须开发A2/A3芯片下的CANN大融合算子,以保持CANN的推理性能竞争力。

Design(设计方案)

1)A3场景可复用vllm-ascend开源的dispatch_ffn_combine算子,仅做一些仓库间的迁移即可
2)A2单机HCCS链路的fullmesh场景,也可复用A3当前方案,仅需针对平台差异化配置项(如平台型号与芯片版本获取接口、HCCL 通信参数封装结构体定义等),以及HCCL 缓存缓冲区的使用逻辑进行少量适配修改
3)A2多机场景,机内HCCS,机间RDMA,不同于A3远端读的方案,A2需要采用远端写的方案;同时,参考dispatch算子实现分层通信的优化手段

likedislike
huang-chuhong成员
4月27日 评论:

你好,这个我们需要commiter评估下,这边会及时跟进commiter意见

likedislike
Lleiqingji成员
4月27日 将 SuperYuan 设为负责人
Ddingxu
4月27日 修改了issue 的描述
Hhuang-chuhong成员
4月28日 关联了看板:Transformer
dingxu
5月30日 评论:

这个issue的后续计划是什么

likedislike
Llyt_claire成员
6月4日 关联了pull request:mega moe def change
此处折叠了39条事件消息 查看更多
唐云飞唐云飞成员
28 天前 关联了pull request:mega_moe相关问题修复同步到9.2.0-beta1