| 新增接口WeightQuantPreprocess Co-authored-by: yan-chengyi123<yanchengyi@huawei.com> Co-authored-by: renzetao<renzetao2@huawei.com> # message auto-generated for no-merge-commit merge: !3832 merge WeightQuantPreprocess into master 新增接口WeightQuantPreprocess Created-by: renzetao Commit-by: renzetao;yan-chengyi123 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本次 PR 新增了 WeightQuantPreprocess 算子接口,用于对量化推理中的权重张量进行预处理转换。主要支持两类数据流:MM_MX_A8W4(矩阵乘,2维权重)和 GMM_MX_A8W4(分组矩阵乘,3维权重),均面向 FLOAT4_E2M1 权重 / FLOAT8_E8M0 scale 的 Mx 量化场景。核心流程是将 ND/NCL 格式的权重转置后通过 TransData 转换为 FORMAT_FRACTAL_NZ_C0_32 格式,并对 weightScale 和 bias 做直接拷贝。接口采用两段式设计(GetWorkspaceSize + 执行),并通过 DataFlowEntry 注册表按 NPU 架构匹配数据流、校验参数、执行业务逻辑。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> [#2230](https://gitcode.com/cann/ops-math/issues/2230) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> 本地验证GMM-MxA8W4,QBMM-MxA8W4 的历史用例pass ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 新增了conversion/weight_quant_preprocess/docs/aclnnWeightQuantPreprocess.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!3832 | 1 个月前 |