| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
feat: support value=None for npu_sparse_flash_attention Co-authored-by: nomiz<1606135114@qq.com> # message auto-generated for no-merge-commit merge: !5725 merge master into master feat: support value=None for npu_sparse_flash_attention Created-by: nomiz Commit-by: nomiz Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/op-plugin/issues/423 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) CANN 9.2.0 起, aclnnSparseFlashAttention 算子层支持可空 value 输入,框架层适配放开限制。 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 是。新增支持value=None的资料说明 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 新增ut用例测试结果  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5725 | 1 个月前 | |
[master][Fix] Fix static check errors detected by clang-format Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !5544 merge clang-format-master-2 into master [master][Fix] Fix static check errors detected by clang-format Created-by: thickhair Commit-by: zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 https://gitcode.com/Ascend/op-plugin/issues/314 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 clang-format错误修复 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5544 | 2 个月前 | |
feat(dequant_swiglu_quant): swiglu_mode校验扩展支持3 opapi侧swiglu_mode参数校验从0/1/2扩展为0/1/2/3,与ops-nn算子仓 swiglu_mode=3(SiLU后clamp变体SwiGLU)支持配套。 | 26 天前 | |
MatmulReduceScatter支持mx量化右矩阵非转置 Co-authored-by: wangkechen<wangkechen3@huawei.com> # message auto-generated for no-merge-commit merge: !5739 merge mmrs_mxnotrans into master MatmulReduceScatter支持mx量化右矩阵非转置 Created-by: Kiana1216 Commit-by: wangkechen Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/op-plugin/issues/440 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 MatmulReduceScatter新增mx量化场景下,支持右矩阵非转置。增加了非转置的校验规则,根据右矩阵是否转置,动态地推导output的shape,同时适配原有的校验逻辑。 # 【资料变更】 不涉及,在IDP平台更新 # 【接口变更】 不涉及 # 【功能验证】 本地出包验证   # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5739 | 1 个月前 | |
[master][Fix] Fix static check errors detected by clang-format Co-authored-by: thickhair<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !5599 merge clang-format-12 into master [master][Fix] Fix static check errors detected by clang-format Created-by: thickhair Commit-by: thickhair Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 https://gitcode.com/Ascend/op-plugin/issues/314 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 修复clang-format错误 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5599 | 1 个月前 | |
feat: WeightQuantPreprocess 新增 A16W4 紧凑排布数据流支持(INT4/FP4/MXFP4) Co-authored-by: maqijun<maqijun@h-partners.com> # message auto-generated for no-merge-commit merge: !5676 merge feat/weight-quant-preprocess-a16w4 into master feat: WeightQuantPreprocess 新增 A16W4 紧凑排布数据流支持(INT4/FP4/MXFP4) Created-by: maqijun Commit-by: maqijun Merged-by: ascend-robot Description: ## WeightQuantPreprocess A16W4(INT4/FP4/MXFP4)数据流支持 ### 概述 为 npu_weight_quant_preprocess 新增 A16W4 紧凑排布(4-bit,uint8 载体)数据流:A16S4 INT4(per-tensor/per-channel/per-group)与 A16F4 FP4(per-group/MX)。torch 接口保持原 9 参形式,**无新增参数**。 ### ND/NZ 内部判定 - 入口按 A16S4 + scale 形状分流:per-tensor(scale 单元素)/ per-channel({N}/{1,N})/ per-group({G,N} G>1) - per-tensor:不支持 NZ,转置/非转置一律 ND 直拷 - per-channel / per-group:非转置 → NZ_C0_16 转换;转置 → ND 直拷;均不支持则报错 - ND/NZ 不体现在 judge/数据流命名上:judge 合并为 judge_mm_a16s4_per_tensor/per_channel/per_group,prepare_out_weight_a16s4 按 is_weight_trans 内部分支 - ND 非转置为纯透传,调用方可不经 preprocess 直接喂 npu_weight_quant_batchmatmul(eager/图模式均已支持 ND uint8 载体) ### 主要修改 1. FORMAT_FAKE_TO_REAL 映射扩展(op_api_common.cpp):NZ_C0_8→NZ_C0_16(A16 4-bit),保留 NZ_C0_16→NZ_C0_32(A8) 2. WeightQuantPreprocessKernelNpuOpApi.cpp:A16S4 三个 judge + prepare 内部分支;A16F4 judge_mm_a16f4_nz_pergroup/judge_mm_a16f4_mx;prepare_out_weight_nz_a16s4(N-first NZ_C0_8 构造);prepare_out_weight_nd/prepare_out_weight_scale_per_channel 保持输入 strides(转置透传) 3. npu_weight_quant_batchmatmul:uint8 载体 4-bit ND weight 按打包方向还原逻辑 K/N;is_weight_nz_4bit_compact 识别 NZ_C0_8/NZ_C0_16 4. meta 推导:uint8 载体 + 4-bit weight_dtype 时按 scale 末维推导逻辑 N ### 验证 - eager:test_torch_nz_perchannel、test_torch_nd_pg(per-tensor×4 + ND pc/pg 转置×4 + NZ pg×2)、test_eager_wqbmmv2_nd_direct(ND 直入 4 流)、test_torch_a16s4_variants(29 条:正向 + 转置自动 ND + 负向) - 图模式(torchair 静态+动态):test_torch_graph_a16s4_all_flows 8 流×16 用例;A16F4 全套 - 存量 MX A8W4 / int8 流程不受影响  --- 关联Issue [#444](https://gitcode.com/Ascend/op-plugin/issues/444) See merge request: Ascend/op-plugin!5676 | 1 个月前 | |
[feat]拆分巨型文件 Co-authored-by: LiNuohang<linuohang@huawei.com> # message auto-generated for no-merge-commit merge: !5479 merge bianyi into master [feat]拆分巨型文件 Created-by: LiNuohang Commit-by: LiNuohang Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1.拆分巨型codegen文件 改前: 全量编译无ccache 18min [2026-07-14 11:46:25] Using PyTorch 2.13.0.dev20260610+cpu .... [2026-07-14 11:56:32] [1294/1298] Building CXX object CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/__OpInterface.cpp.o [2026-07-14 12:03:34] [1295/1298] Building CXX object CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi.cpp.o [2026-07-14 12:03:35] [1296/1298] Linking CXX shared library packages/torch_npu/lib/libtorch_npu.so [2026-07-14 12:03:35] [1297/1298] Linking CXX shared library packages/torch_npu/lib/libop_plugin_atb.so 全量编译耗时长杆: [2026-07-16 11:20:23] [6/1295/1298 344.920s] Building CXX object CMakeFiles/torch_npu.dir/torch_npu/csrc/afd/Init.cpp.o [2026-07-16 11:20:24] [5/1295/1298 345.788s] Building CXX object CMakeFiles/torch_npu.dir/torch_npu/csrc/npu/Graph.cpp.o [2026-07-16 11:20:37] [4/1295/1298 358.510s] Building CXX object CMakeFiles/torch_npu.dir/torch_npu/csrc/npu/Module.cpp.o [2026-07-16 11:20:55] [3/1295/1298 376.786s] Building CXX object CMakeFiles/torch_npu.dir/torch_npu/csrc/distributed/ProcessGroupHCCL.cpp.o [2026-07-16 11:22:01] [2/1295/1298 442.896s] Building CXX object CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/OpInterface.cpp.o [2026-07-16 11:29:08] [1/1295/1298 869.507s] Building CXX object CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi.cpp.o [2026-07-16 11:29:08] [1/1296/1298 870.165s] Linking CXX shared library packages/torch_npu/lib/libtorch_npu.so [2026-07-16 11:29:08] [1/1297/1298 870.258s] Linking CXX shared library packages/torch_npu/lib/libop_plugin_atb.so 编译耗时排名: 595627 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi.cpp.o 242710 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/RegisterNPU.cpp.o 153605 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/OpInterface.cpp.o 111907 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/CustomFunctions.cpp.o 110520 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/FlashAttentionKernelNpuOpApi.cpp.o 101897 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/CustomRegisterSchema.cpp.o 92198 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/FlashAttentionV2KernelNpuOpApi.cpp.o 88972 third_party/torchair/CMakeFiles/copy_torchair_pyfiles 88972 /home/linuohang/package/bianyi/PTA-CODE/torch_npu/build/third_party/torchair/CMakeFiles/copy_torchair_pyfiles 77577 CMakeFiles/torch_npu.dir/torch_npu/csrc/distributed/ProcessGroupHCCL.cpp.o 56191 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/CustomRedispatch.cpp.o 52131 CMakeFiles/torch_npu.dir/torch_npu/csrc/core/npu/NPUCachingAllocator.cpp.o 51924 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/VariableType_0.cpp.o 51337 CMakeFiles/torch_npu.dir/torch_npu/csrc/npu/Module.cpp.o 51312 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/MatmulAllReduceBaseKernelNpuOpApi.cpp.o 48609 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/FusedInferAttentionScoreKernelNpuOpApi.cpp.o 48146 CMakeFiles/torch_npu.dir/torch_npu/csrc/inductor/dvm/pybind_api.cpp.o 47171 CMakeFiles/torch_npu.dir/torch_npu/csrc/aten/Functions.cpp.o 45263 /home/linuohang/package/bianyi/PTA-CODE/torch_npu/third_party/dvm/dvm/libdvm.a 43958 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/MlaPrologV3KernelNpuOpApi.cpp.o 43386 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/DivKernelNpuOpApi.cpp.o 43324 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/GtKernelNpuOpApi.cpp.o 43055 CMakeFiles/torch_npu.dir/torch_npu/csrc/distributed/Init.cpp.o 40365 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/LeKernelNpuOpApi.cpp.o 39415 CMakeFiles/torch_npu.dir/third_party/op-plugin/op_plugin/ops/opapi/LtKernelNpuOpApi.cpp.o # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 改后: 全量编译无ccache 8min。无长杆。 [2026-07-16 19:33:30] Using PyTorch 2.13.0.dev20260610+cpu ....... [2026-07-16 19:38:53] [88:1301/1406 238.557s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/OpInterface_7.cpp.o [2026-07-16 19:38:53] [88:1302/1406 238.657s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/OpInterface_25.cpp.o [2026-07-16 19:38:53] [88:1303/1406 238.678s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/utils/custom_functions/aclops/TriangularSolveKernelNpu.cpp.o [2026-07-16 19:38:53] [88:1304/1406 238.699s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_17.cpp.o [2026-07-16 19:38:53] [88:1305/1406 238.731s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_3.cpp.o [2026-07-16 19:38:53] [88:1306/1406 238.753s] Building CXX object CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/OpInterface_27.cpp.o [2026-07-16 19:38:53] [88:1307/1406 238.970s] Building CXX object CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/framework/utils/ForceAclnnList.cpp.o ....... [2026-07-16 19:40:44] [5:1404/1406 349.560s] Building CXX object third_party/op-plugin/op_plugin/CMakeFiles/op_plugin_atb.dir/ops/atb/FusedAddDivAtb.cpp.o [2026-07-16 19:40:44] [4:1404/1406 349.957s] Building CXX object third_party/op-plugin/op_plugin/CMakeFiles/op_plugin_atb.dir/ops/atb/RopeAtb.cpp.o [2026-07-16 19:40:45] [3:1404/1406 350.966s] Building CXX object third_party/op-plugin/op_plugin/CMakeFiles/op_plugin_atb.dir/ops/atb/RingMlaAtb.cpp.o [2026-07-16 19:40:46] [2:1404/1406 351.732s] Building CXX object third_party/op-plugin/op_plugin/CMakeFiles/op_plugin_atb.dir/ops/atb/MLAPreprocessAtb.cpp.o [2026-07-16 19:40:47] [1:1404/1406 353.319s] Building CXX object third_party/op-plugin/op_plugin/CMakeFiles/op_plugin_atb.dir/ops/atb/MultiHeadLatentAttentionAtb.cpp.o [2026-07-16 19:40:48] [1:1405/1406 353.438s] Linking CXX shared library packages/torch_npu/lib/libop_plugin_atb.so [2026-07-16 19:40:48] running build_ext 编译耗时排名 116.0 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/aten/CustomFunctions.cpp.o 110.3 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/FlashAttentionKernelNpuOpApi.cpp.o 99.6 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/aten/CustomRegisterSchema.cpp.o 89.9 s third_party/torchair/CMakeFiles/copy_torchair_pyfiles 89.9 s /home/linuohang/package/bianyi/PTA-MASTER-310/torch_npu/build/third_party/torchair/CMakeFiles/copy_torchair_pyfiles 79.5 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/distributed/ProcessGroupHCCL.cpp.o 79.0 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/FlashAttentionV2KernelNpuOpApi.cpp.o 53.7 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/npu/Module.cpp.o 52.2 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/aten/CustomRedispatch.cpp.o 50.9 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_16.cpp.o 50.6 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_17.cpp.o 49.0 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/MatmulAllReduceBaseKernelNpuOpApi.cpp.o 48.9 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_8.cpp.o 47.4 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/core/npu/NPUCachingAllocator.cpp.o 47.0 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_3.cpp.o 45.7 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_30.cpp.o 45.7 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_0.cpp.o 44.8 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/distributed/Init.cpp.o 44.2 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_26.cpp.o 44.0 s /home/linuohang/package/bianyi/PTA-MASTER-310/torch_npu/third_party/dvm/dvm/libdvm.a 43.7 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_29.cpp.o 42.8 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/MlaPrologV3KernelNpuOpApi.cpp.o 41.2 s CMakeFiles/torch_npu_objs.dir/torch_npu/csrc/aten/Functions.cpp.o 40.5 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/DivKernelNpuOpApi.cpp.o 40.2 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_1.cpp.o 39.7 s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/ops/opapi/StructKernelNpuOpApi_15.cpp.o ....... 25.7s CMakeFiles/torch_npu_objs.dir/third_party/op-plugin/op_plugin/OpInterface_9.cpp.o # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5479 | 2 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 2 个月前 | ||
| 26 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 2 个月前 |