| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
产品文档中png文件改为英文名 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !8300 merge master into master 产品文档中png文件改为英文名 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 产品文档中的png图片名由中文改为英文 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> [#4260](https://gitcode.com/cann/ops-nn/issues/4260) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> NA ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> png和相关的link md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8300 | 1 个月前 | |
cannsim改名为npusim Co-authored-by: liangbinglong<liangbinglong@huawei.com> # message auto-generated for no-merge-commit merge: !8349 merge master into master cannsim改名为npusim Created-by: liangbinglong Commit-by: liangbinglong Merged-by: cann-robot Description: ## 描述 经TSC评审,cannsim工具正式更名为npusim,相关命令行、资料同步刷新,cannsim作为别名兼容一段时间,需要尽快切换 ## 关联的Issue NA ## 测试 使用最新链接版本测试,相关命令行已经全部更名为npusim ## 文档更新 更新doc下面的调优部分文件 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8349 | 1 个月前 | |
flat_quant切tensorApi Co-authored-by: wuyufei<wuyufei13@huawei.com> # message auto-generated for no-merge-commit merge: !8477 merge master into master flat_quant切tensorApi Created-by: wuyufei Commit-by: wuyufei Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本次 PR 将 flat_quant 算子中 TILING_KEY 为 6 的分支从原有的 Cmct 后端实现切换为基于 Blaze 框架和 Tensor API 的新实现。新增了 flat_quant_blaze.h 头文件,定义模板函数 FlatQuantBlazeKernel,统一封装 Blaze GEMM 的 BlockMmad、BlockScheduler 和 Epilogue 等组件;同时在 flat_quant_apt.cpp 中将 include 和调用从 FlatQuantCmctKernel 替换为 FlatQuantBlazeKernel,并移除了对 Cmct 命名空间的依赖。 同时存在算子目录整改,由ops-nn/quant -> ops-nn/matmul ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5094 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8477 | 15 天前 | |
docs: 新增SoftmaxGradExtFusionPass/SoftmaxGradExtV2FusionPass/AscendQuantV2ScatterFusionPass/PReluGradFusionPass融合pass文档 Co-authored-by: yuanbin_22<yuanbin22@huawei.com> # message auto-generated for no-merge-commit merge: !9734 merge docs/sync-fusion-pass-soft-quant into master docs: 新增SoftmaxGradExtFusionPass/SoftmaxGradExtV2FusionPass/AscendQuantV2ScatterFusionPass/PReluGradFusionPass融合pass文档 Created-by: yuanbin_22 Commit-by: yuanbin_22 Merged-by: cann-robot Description: ## 描述 新增四个融合 pass 的说明文档,补充融合模式、使用约束及支持的型号信息: - **SoftmaxGradExtFusionPass**:将 Mul、ReduceSum、Sub 小算子融合为 SoftmaxGradExt 算子,支持 Ascend 950PR/950DT。 - **SoftmaxGradExtV2FusionPass**:SoftmaxGradExt 融合的 V2 版本,覆盖4种融合场景,支持 Ascend 950PR/950DT。 - **AscendQuantV2ScatterFusionPass**:将 AscendQuantV2 + Scatter 结构融合为 QuantUpdateScatter 算子,支持 Ascend 950PR/950DT。 - **PReluGradFusionPass**:将 PReluGrad 算子拆分为 PReluGradUpdate 和 PReluGradReduce 两个算子,支持 Ascend 950PR/950DT。 同时新增 7 张融合模式示意图(LFS)。 ## 关联的Issue #5497 ## 测试 纯文档更新,无需测试。 ## 文档更新 - 新增 activation/softmax_grad_ext/docs/SoftmaxGradExtFusionPass.md - 新增 activation/softmax_grad_ext/docs/SoftmaxGradExtV2FusionPass.md - 新增 activation/p_relu_grad_update/docs/PReluGradFusionPass.md - 新增 quant/ascend_quant_v2/docs/AscendQuantV2ScatterFusionPass.md - 新增 docs/zh/figures/ 下 7 张配图 ## 类型标签 - [x] 文档更新 ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9734 | 20 小时前 | |
fix quickstart Co-authored-by: caiwenwen<caiwenwen6@h-partners.com> # message auto-generated for no-merge-commit merge: !9897 merge master into master fix quickstart Created-by: caiwenwen Commit-by: caiwenwen Merged-by: cann-robot Description: ## 描述 修改quickstart的内容 ## 关联的Issue 关联Issue #3840 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9897 | 6 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 13 天前 | |
FusedAdam算子950实现 Co-authored-by: Tower19<liudingming3@huawei.com> # message auto-generated for no-merge-commit merge: !8934 merge master into master FusedAdam算子950实现 Created-by: Tower19 Commit-by: Tower19 Merged-by: cann-robot Description: ## 描述 完成FusedAdam算子kernel实现 ## 关联的Issue 待补充 ## 测试 待补充 ## 文档更新 更新了相关readme文档 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!8934 | 7 天前 | |
tqbmm torch接口新增文档内容 Co-authored-by: huangkejie1647<huangkejie3@huawei.com> # message auto-generated for no-merge-commit merge: !9682 merge tqbmm_docs into master tqbmm torch接口新增文档内容 Created-by: huangkejie1647 Commit-by: huangkejie1647 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本pr 主要为 tqbmm torch接口新增文档内容 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> [#5471](https://gitcode.com/cann/ops-nn/issues/5471) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 不涉及 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> docs/zh/menu_torch_api.md matmul/transpose_quant_batch_mat_mul/docs/torchapi_transpose_quant_batch_mat_mul.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9682 | 8 天前 | |
fix(foreach,lamb,scatter_list): ForeachAddc*List 补 Div 0ULP 精度档 + LambApplyOptimizerAssign 支持面订正 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !10142 merge fix/tp-fused-and-scatterlist-doc into master fix(foreach,lamb,scatter_list): ForeachAddc*List 补 Div 0ULP 精度档 + LambApplyOptimizerAssign 支持面订正 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 本 PR 包含三组修复,均由 TTK 三方精度比对(cross_check)跑批暴露的红灯定位而来。 ### 1. ForeachAddcmulList / ForeachAddcdivList:补 Div 0 ULP 精度档(内核) foreach/foreach_utils/op_kernel/arch35/foreach_addc_list_regbase.h 中的 Div 此前未指定 DivConfig,落到缺省 DivAlgo::INTRINSIC——该档在 dav-3510 上仅保真到 1 ULP。 - 实测 fp32 用例 **23689/524288(4.52%)** 元素与正确舍入结果相差 1 ULP - 在 x1 与 scalars*(x2/x3) 几乎相消的点上,该偏差被放大成上千 ULP 的相对误差,cross_check 的 mare 判据因此报红(实测 mare 29.87 > L1 阈值 5.0) - 显式改用 DivAlgo::PRECISION_0ULP_FTZ_TRUE 后,输出与正确舍入结果**逐位相同(0/524288)** 仓内 20/22 处显式 Div 配置均选 0ULP 档,本文件此前漏配;兄弟算子 foreach_div_list_inplace 已修过同一问题。addcmul 走 Mul 分支不受影响;ComputeIntPath 的整数 Div 未改。 ### 2. LambApplyOptimizerAssign:支持面订正(资料 + host 校验 + UT) 原 README 声明 grad 与 input3 均可小于 inputv/inputm 并向上广播,但底层 Ops::Base 广播模板的 DoDimensionCollapse **不支持对 In0(即 grad)做广播**: - grad 为标量时 EnsureNotScalar 只抬到 {1}、不左补 1 对齐输出 rank → The 1 input's dim num is not same with output's dim num - grad 与输出同 rank 但某维为 1 → The 1 input's dim index is not same with out, and not 1 - 实测支持面矩阵:grad 在任意单维广播均被拒;input3 支持 () / (1,) / (1,1,1) / (4,) / (1,3,4) / (2,1,4),仅 rank 大于输出时不支持 改动: - README 订正为「grad/inputv/inputm 三者 shape 必须完全相同,仅 input3 按右对齐 broadcast 规则向 inputv 对齐」 - infershape 与 tiling 的 CheckInplaceShapeConstraint 同步改为严格等形,使非法组合在 host 阶段被清晰拒绝,而不是放行后到 tiling 阶段抛 E90003 - infershape 三处 shape 校验统一改用结构化日志宏 OP_LOGE_FOR_INVALID_SHAPE(S)_WITH_REASON,与 tiling 侧口径一致 - UT 同步更新:原 moment_shape_decides_output_shape 断言的是旧广播语义,已改为等形;新增 grad_smaller_than_moment_is_rejected 与 input3_broadcast_into_moment_is_accepted ### 3. 三方腿与资料订正(golden / docs) - foreach_add_list_inplace / foreach_sub_list_inplace 的三方腿改用两步拼接(_foreach_mul + _foreach_add),不再用 alpha= 的融合形式。融合形式是一次 FMA 舍入,与 CPU golden 的两步舍入序列不同,两者恒差 1 ULP:实测 107/107 例 |NPU−真值| + |三方−真值| 精确等于 1.0000 ULP,mare 恒为 1.000。分离后三个种子(0/1/7)各 20/20 全通过。 - foreach_addcmul_list / foreach_addcdiv_list 的 golden 补 e2e 三方腿适配类 _TpE2e(TTK 按 torch 重载形参名 self/tensor1/tensor2/scalars 下发,与 def 注册名 x1/x2/x3/scalars 不同,直接复用 kernel 腿竞品类会抛 UnknownParamError);并**标注这两个算子实际不具备 e2e 通路支持**——aten::_foreach_addc{mul,div}.Tensor 在追踪期即抛 Expected scalars to be on CPU,torch.compile 建不了图,torchair converter 走不到,需手工给已安装的 torch_npu 补 meta 注册才能跑通,该补丁不在本仓、重装即失效,故不作为已交付通路。 - ScatterList 资料补 maskOptional 取值范围,并修正 mask 维度列笔误(0-8 → 1 维);aclnnScatterMin 补索引取值范围;op_api_list 补 ForeachAddcmul/AddcdivList 的确定性说明。 ## 关联的Issue 关联 Issue #5750 —— https://gitcode.com/cann/ops-nn/issues/5750 ## 测试 - **LambApplyOptimizerAssign op_host UT**:bash build.sh -u --ops=lamb_apply_optimizer_assign --soc=ascend950 → **14/14 PASSED**(含 2 条新增用例) - **Div 精度档位(JIT 在线编译,源码级 A/B)**:同用例同区间下,改前 23689/524288(4.518%)元素偏离正确舍入,改后 **0/524288** - **部署二进制验证(重新出包 + 部署,确认被测 == 当前源码)**:ForeachAddcdivList 在 kernel / aclnn / GE 图三条通路上 mare = mere = rmse = 1(即与 golden 逐位相同) - **LambApplyOptimizerAssign 支持面矩阵(静态 GE 通路)**:grad 等形 + input3 降 rank 用例 PASS;grad 标量 / grad 含 1 维用例在 host 阶段被拒,报错文案为 Parameter grad of op1 has incorrect shape [1]. Reason: grad does not support broadcast and must have exactly the same shape as inputv/inputm - **pre-commit**:clang-format / ruff-check / ruff-format / codespell / trailing-whitespace / end-of-file-fixer 本地全部通过 - ⚠️ **待补**:foreach_addcdiv_list(1437 例)与 lamb_apply_optimizer_assign 泛化集回归正在跑批中,结果将补充到本 PR 评论 ## 文档更新 - optim/lamb_apply_optimizer_assign/README.md:输入/输出 shape 描述与《约束说明》改写 - index/scatter_list/README.md、index/scatter_list/docs/aclnnScatterList.md:mask 取值范围与维度笔误订正 - docs/zh/op_api_list.md:补 ForeachAddcmul/AddcdivList 确定性说明 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!10142 | 22 小时前 | |
Centralization 算子下一代支持 Co-authored-by: 岩80<1611150171@qq.com> # message auto-generated for no-merge-commit merge: !9814 merge master into master Centralization 算子下一代支持 Created-by: 2403_87792773 Commit-by: 岩80 Merged-by: cann-robot Description: ## 描述 新增 Centralization 算子,在指定轴上计算输入均值,并从输入对应元素中逐元素减去,输出 保持与输入相同的 shape 和 dtype。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> 关联Issue#5533 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 已完成 Ascend 950PR 环境下的验证: - release binary 泛化验证:1010/1010 PASS; - 本地精度验证:200/200 PASS; - GEIR 通路验证:60/60 PASS; - TensorFlow parser 通路验证:60/60 PASS; - DFX 验证:8/8 PASS; - code-check 和 C/C++ 格式检查已执行; - GPU 性能、三方精度和性能验证按当前任务要求未执行。 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> - 新增 norm/centralization/README.md; - 更新 docs/zh/op_list.md; - 补充算子参数、约束、产品支持范围和调用方式说明。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9814 | 4 天前 | |
tqbmm torch接口新增文档内容 Co-authored-by: huangkejie1647<huangkejie3@huawei.com> # message auto-generated for no-merge-commit merge: !9682 merge tqbmm_docs into master tqbmm torch接口新增文档内容 Created-by: huangkejie1647 Commit-by: huangkejie1647 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本pr 主要为 tqbmm torch接口新增文档内容 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> [#5471](https://gitcode.com/cann/ops-nn/issues/5471) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 不涉及 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> docs/zh/menu_torch_api.md matmul/transpose_quant_batch_mat_mul/docs/torchapi_transpose_quant_batch_mat_mul.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9682 | 8 天前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 1 个月前 | ||
| 15 天前 | ||
| 20 小时前 | ||
| 6 天前 | ||
| 13 天前 | ||
| 7 天前 | ||
| 8 天前 | ||
| 22 小时前 | ||
| 4 天前 | ||
| 8 天前 |