已关闭
[Requirement|需求建议]: 新增 allto_all_matmul_v2 算子——MC2 通算融合 AlltoAll+MX量化MatMul APACE架构适配(DAV_3510) #4713
MeiWenxuan创建于 8月29日关闭于 8月29日
8月29日 添加了label:requirement
8月29日 修改了issue 的描述
8月29日 关联了pull request:add allto_all_matmul_v2 operator
8月29日 修改了issue 的描述
8月29日 关闭了 issue
8月29日 添加了label:resolved
28 天前 关联了pull request:AlltoAllMatmulV2 Torch接口文档描述更正
27 天前 删除了关联的pull request:AlltoAllMatmulV2 & AllGatherMatmulV3 Torch接口文档描述更正
27 天前 关联了pull request:AlltoAllMatmulV2 & AllGatherMatmulV3 comm_mode urma场景改成aiv_urma
26 天前 关联了pull request:fix(allto_all_matmul_v2): 修复 group_sizes schema 非法默认值导致 import 失败
MMeiWenxuan
12 天前 关联了pull request:fix(allto_all_matmul_v2/all_gather_matmul_v3): comm_mode 默认值从 ai_cpu 改为 aiv_urma
12 天前 关联了pull request:fix(allto_all_matmul_v2/all_gather_matmul_v3): comm_mode 默认值从 ai_cpu 改为 aiv_urma
MMeiWenxuan
12 天前 关联了pull request:fix(allto_all_matmul_v2/all_gather_matmul_v3): comm_mode 默认值从 ai_cpu 改为 aiv_urma
12 天前 关联了pull request:fix(allto_all_matmul_v2/all_gather_matmul_v3): comm_mode 默认值从 ai_cpu 改为 aiv_urma
6 天前 关联了pull request:allto_all_mm_v2 set scheddule mode to 1
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
Backgroud(背景信息)
本需求新增
allto_all_matmul_v2算子,作为APACE架构AIV直驱URMA Kernel代码的host适配。将 AlltoAll 通信(URMA 协议)+ MX 量化反量化 + MatMul 计算 融合为单一算子,在 DAV_3510(Ascend 950)平台上通过 AIC/AIV 协同实现通算融合,通信与计算充分流水,消除中间 GM 落盘。Benefit / Necessity (价值/作用)
应用场景:MoE 模型的 Expert 并行(EP)层,每个 rank 持有部分 expert 权重,需要 AlltoAll 交换 token 后本地计算 matmul。
核心价值:
关键特性:
[M, Ceil(K/64), 2],支持 ND/NCL 格式Design(设计方案)
Torch 接口
all_to_all_quant_matmul( x1, x2, group, # 必传:左矩阵、右矩阵、通信域 bias=None, x1_scale=None, x2_scale=None, # 可选:MX量化参数 x1_quant_mode=None, x2_quant_mode=None, # 可选:量化模式(当前只支持6, 6) group_sizes=None, # 可选:量化group size(默认自动推导) y_dtype=None, comm_mode=None, precision_mode=None, # 可选:输出精度/通信引擎/精度模式 ) -> (y, None)