| trans仓打标签合入 Co-authored-by: caiwenwen<caiwenwen6@h-partners.com> # message auto-generated for no-merge-commit merge: !9424 merge master into master trans仓打标签合入 Created-by: caiwenwen Commit-by: caiwenwen Merged-by: cann-robot Description: ## 描述 ffn gmm mamba / causal_conv1d mc2 mhc这5个仓的aclnn文档 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 ffn gmm mamba / causal_conv1d mc2 mhc ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [x] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!9424 | 2 天前 |
| GMM arch35相关代码进行 clang-format 格式整改 Co-authored-by: zhangzhizhuo<zhangzhizhuo1@huawei.com> # message auto-generated for no-merge-commit merge: !8883 merge fixformat into master GMM arch35相关代码进行 clang-format 格式整改 Created-by: zhangzhizhuo Commit-by: zhangzhizhuo Merged-by: cann-robot Description: ## 描述 本次 PR 对 GMM arch35相关代码进行 clang-format 格式整改,统一代码风格,减少后续 pre-commit 检查中的格式告警。 整改范围如下: - 完整整改 gmm/common/cgmct 目录下的 C/C++ 文件。 - 其他 GMM 算子仅整改 arch35 子目录下的文件。 - 不整改以下两个算子: - gmm/grouped_matmul_swiglu_quant - gmm/quant_grouped_matmul_dequant 所有修改均为 clang-format 产生的代码格式调整,不涉及功能逻辑、接口或算法变更。 ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/3797 ## 测试 gmm 类二级冒烟验证 ## 文档更新 不涉及文档更新。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [x] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8883 | 12 天前 |
| fix(gmmaq): print y dtype name instead of numeric value in error logs Co-authored-by: zhoushaolong<zhoushaolong3@huawei.com> # message auto-generated for no-merge-commit merge: !8925 merge fix/gmmaq-y-dtype-log into master fix(gmmaq): print y dtype name instead of numeric value in error logs Created-by: zhoushaolong Commit-by: zhoushaolong Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> grouped_matmul_activation_quant 算子在校验 y dtype 时,错误日志仅打印 dtype 的数值(如 0、36),用户无法直接识别传入的具体 dtype,排错困难。本次改动将三个入口的错误日志统一改为打印可读的 dtype 名称(如 FLOAT、FLOAT8_E4M3FN)。 改动内容: - gmm/.../aclnn_grouped_matmul_activation_quant_weight_nz.cpp:将 OP_LOGE_FOR_INVALID_VALUE_WITH_REASON 替换为 OP_LOGE_FOR_INVALID_DTYPE_WITH_REASON,并通过 op::ToString(static_cast<DataType>(effectiveYDtype)) 输出 dtype 名称。 - torch_extension/.../csrc/grouped_matmul_activation_quant.cpp:新增 GetDtypeName(int64_t dtype),将 GE dtype 数值映射为可读名称(FLOAT / FLOAT8_E5M2 / FLOAT8_E4M3FN / FLOAT8_E8M0 / FLOAT4_E2M1 / FLOAT4_E1M2 / UNKNOWN);GetYScalarType 中的 TORCH_CHECK 改用 GetDtypeName(yDtype)。 - torch_extension/.../grouped_matmul_activation_quant.py:新增 GE_DTYPE_FLOAT4_E2M1=40、GE_DTYPE_FLOAT4_E1M2=41 常量与 _GE_DTYPE_TO_NAME 字典;_to_torch_dtype 的 TypeError 改用 dtype 名称。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> #3854 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> 传入非法 y_dtype(如 FLOAT / FLOAT8_E8M0 / FLOAT4_E2M1)触发校验失败,确认三类入口(aclnn op_api、torch_extension C++、torch_extension Python)的错误信息均打印可读 dtype 名称而非数值。 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 无 ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8925 | 10 天前 |
| Add GroupedMatmulActivationQuant aclnn torch path Co-authored-by: zhoushaolong<zhoushaolong3@huawei.com> # message auto-generated for no-merge-commit merge: !8089 merge gmmaq-zsl into master Add GroupedMatmulActivationQuant aclnn torch path Created-by: zhoushaolong Commit-by: zhoushaolong Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增算子 GroupedMatmulActivationQuant的torch和aclnn通路,支持分组矩阵乘后接激活函数(GELU-Tanh)及 MX 量化输出。 该算子基于 GroupedMatmul 扩展,在分组矩阵乘计算完成后,依次执行: 1. **激活函数**:GELU-Tanh 2. **量化**:将 FP32/BF16 中间结果量化为 FP8(E4M3FN 或 E5M2) 3. **输出**:量化后的数据 + FP8 E8M0 scale ### 主要特性 - **数据类型**:输入 x为 FP8 E5M2 或 FP8 E4M3FN,weight 为 FP8 E4M3FN,scale 为 FP8 E8M0 - **输出类型**:支持 FP8 E4M3FN / E5M2(通过 y_dtype attr 配置) - **分组模式**:仅支持 SPLIT_M(M 轴分组) - **Weight 格式**:强制 FRACTAL_NZ 格式 - **量化模式**:MX per-group 量化 - **舍入模式**:RINT - **Scale 算法**:支持 OCP / CUBLAS 两种算法(通过 scale_alg attr 配置) ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/3505 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> 算子泛化+二级冒烟 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> gmm/grouped_matmul_activation_quant/README.md gmm/grouped_matmul_activation_quant/docs/aclnnGroupedMatmulActivationQuantWeightNz.md torch_extension/cann_ops_transformer/docs/zh/grouped_matmul_activation_quant.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8089 | 27 天前 |
| GMM arch35相关代码进行 clang-format 格式整改 Co-authored-by: zhangzhizhuo<zhangzhizhuo1@huawei.com> # message auto-generated for no-merge-commit merge: !8883 merge fixformat into master GMM arch35相关代码进行 clang-format 格式整改 Created-by: zhangzhizhuo Commit-by: zhangzhizhuo Merged-by: cann-robot Description: ## 描述 本次 PR 对 GMM arch35相关代码进行 clang-format 格式整改,统一代码风格,减少后续 pre-commit 检查中的格式告警。 整改范围如下: - 完整整改 gmm/common/cgmct 目录下的 C/C++ 文件。 - 其他 GMM 算子仅整改 arch35 子目录下的文件。 - 不整改以下两个算子: - gmm/grouped_matmul_swiglu_quant - gmm/quant_grouped_matmul_dequant 所有修改均为 clang-format 产生的代码格式调整,不涉及功能逻辑、接口或算法变更。 ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/3797 ## 测试 gmm 类二级冒烟验证 ## 文档更新 不涉及文档更新。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [x] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8883 | 12 天前 |
| GMM arch35相关代码进行 clang-format 格式整改 Co-authored-by: zhangzhizhuo<zhangzhizhuo1@huawei.com> # message auto-generated for no-merge-commit merge: !8883 merge fixformat into master GMM arch35相关代码进行 clang-format 格式整改 Created-by: zhangzhizhuo Commit-by: zhangzhizhuo Merged-by: cann-robot Description: ## 描述 本次 PR 对 GMM arch35相关代码进行 clang-format 格式整改,统一代码风格,减少后续 pre-commit 检查中的格式告警。 整改范围如下: - 完整整改 gmm/common/cgmct 目录下的 C/C++ 文件。 - 其他 GMM 算子仅整改 arch35 子目录下的文件。 - 不整改以下两个算子: - gmm/grouped_matmul_swiglu_quant - gmm/quant_grouped_matmul_dequant 所有修改均为 clang-format 产生的代码格式调整,不涉及功能逻辑、接口或算法变更。 ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/3797 ## 测试 gmm 类二级冒烟验证 ## 文档更新 不涉及文档更新。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [x] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8883 | 12 天前 |
| 增加 GroupedMatmulActivationQuant UT test Co-authored-by: lirh<lironghui4@huawei.com> # message auto-generated for no-merge-commit merge: !8191 merge lirh into master 增加 GroupedMatmulActivationQuant UT test Created-by: lironghui4 Commit-by: lirh Merged-by: cann-robot Description: ## 描述 add GroupedMatmulActivationQuant UT test ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/3505 ## 测试 算子泛化+二级冒烟 ## 文档更新 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [x] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8191 | 27 天前 |
| Add OP GroupedMatmulActivationQuant kernel and tiling Co-authored-by: jayshu<shuhaojie@huawei.com> # message auto-generated for no-merge-commit merge: !8029 merge gmmactivationquant_jayshu into master Add OP GroupedMatmulActivationQuant kernel and tiling Created-by: jayshu Commit-by: jayshu Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增算子 GroupedMatmulActivationQuant,支持分组矩阵乘后接激活函数(GELU-Tanh)及 MX 量化输出。 该算子基于 GroupedMatmul 扩展,在分组矩阵乘计算完成后,依次执行: 1. **激活函数**:GELU-Tanh 2. **量化**:将 FP32/BF16 中间结果量化为 FP8(E4M3FN 或 E5M2) 3. **输出**:量化后的数据 + FP8 E8M0 scale ### 主要特性 - **数据类型**:输入 x为 FP8 E5M2 或 FP8 E4M3FN,weight 为 FP8 E4M3FN,scale 为 FP8 E8M0 - **输出类型**:支持 FP8 E4M3FN / E5M2(通过 y_dtype attr 配置) - **分组模式**:仅支持 SPLIT_M(M 轴分组) - **Weight 格式**:强制 FRACTAL_NZ 格式 - **量化模式**:MX per-group 量化 - **舍入模式**:RINT - **Scale 算法**:支持 OCP / CUBLAS 两种算法(通过 scale_alg attr 配置) ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/3505 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> 算子泛化+二级冒烟 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 这个PR不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8029 | 27 天前 |
| docs: 修复 GroupedMatmulActivationQuant 算子文档 Co-authored-by: zhoushaolong<zhoushaolong3@huawei.com> # message auto-generated for no-merge-commit merge: !8803 merge fixgmmaqziliao into master docs: 修复 GroupedMatmulActivationQuant 算子文档 Created-by: zhoushaolong Commit-by: zhoushaolong Merged-by: cann-robot Description: ## 描述 修复 GroupedMatmulActivationQuant(WeightNz)算子文档,涉及 README、aclnn 接口文档和 torch_extension 文档三处,主要内容如下: - **README.md**:将 MX 动态量化 blocksize 从 64 修正为 32;精简约束说明,移除与 aclnn 文档重复的约束条目,仅保留核心约束(x 非转置、N 为 64 整数倍及 group_list 范围、bias 空值处理)。 - **aclnnGroupedMatmulActivationQuantWeightNz.md**: - 参数表为全部参数补充 C++ 类型标注(如 x(const aclTensor *)、weight(const aclTensorList *))。 - 修正 aclOpExecutor **executor 代码对齐。 - 更新 dstTypeMax 预留值说明:明确为"后续数据类型为 FLOAT4_E2M1 且 blocksize 为 32 的场景预留"。 - 精简 Ascend 950PR/950DT 约束段落,移除冗余条目。 - 将 ACLNN_ERR_PARAM_INVALID(161002)错误描述拆分为 5 行独立条目,提升可读性。 - 移除确定性计算段落中与约束说明重复的描述。 - **torch_extension/grouped_matmul_activation_quant.md**:参数表"维度(shape)"列由具体 shape 表达式改为维度数(如 (M, K) → 2);移除冗余约束条目。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> #3795 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> 本次为纯文档修改,不涉及代码逻辑变更,无需功能测试。 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> - 更新 gmm/grouped_matmul_activation_quant/README.md - 更新 gmm/grouped_matmul_activation_quant/docs/aclnnGroupedMatmulActivationQuantWeightNz.md - 更新 torch_extension/cann_ops_transformer/docs/zh/grouped_matmul_activation_quant.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [x] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8803 | 16 天前 |