| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 5 天前 | |
adam_apply_one_assign 算子geir测试用例修改 Co-authored-by: h1234515<huangzhiyuan21@huawei.com> # message auto-generated for no-merge-commit merge: !9253 merge adam_apply_one_assign_geir into master adam_apply_one_assign 算子geir测试用例修改 Created-by: h1234515 Commit-by: h1234515 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> adam_apply_one_assign 算子geir用例修改 跑bash build.sh --run_example adam_apply_one_assign graph --soc=ascend950时报错,将geir用例的static_cast<float*>改为(float*) ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5233 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> bash build.sh --run_example adam_apply_one_assign graph --soc=ascend950 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9253 | 7 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 5 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 8 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
fix(op_graph): 30 个算子原型头补 OPS_PROTO_DEF 隔离宏 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9218 merge fix/proto-isolation-macro into master fix(op_graph): 30 个算子原型头补 OPS_PROTO_DEF 隔离宏 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 **改动原因** op_graph/*_proto.h 中的 REG_OP 会被 scripts/util/merge_proto.py 合并进 ops_proto_nn.h/.cpp,再编成内置 op_proto 库(cmake/gen_ops_info.cmake 的 merge_graph_headers → cmake/symbol.cmake 的 gen_opgraph_symbol)。当同名算子在 canndev 侧的遗留原型头(nn_norm_ops.h、reduce_ops.h、ops_proto_legacy.h 等)也有 REG_OP 注册时,两份定义进入同一编译单元会重复定义。 仓库既有范式是在 REG_OP 外层加条件编译隔离宏,merge_proto.py 的匹配式会把该宏一并带入合并产物。本仓已有 activation/relu6_d、optim/sgd、norm/in_training_reduce_v2、vfusion/normalize_bbox 等先例,但本批 30 个算子的原型头遗漏了该保护。检视意见整改。 **改动方法** 对 30 个算子的 op_graph/*_proto.h,在 REG_OP 外层补 #ifndef/#define OPS_PROTO_DEF_<OPTYPE> … #endif: c #ifndef OPS_PROTO_DEF_DEEPNORM #define OPS_PROTO_DEF_DEEPNORM REG_OP(DeepNorm) ... .OP_END_FACTORY_REG(DeepNorm) #endif // OPS_PROTO_DEF_DEEPNORM 宏名取 OPS_PROTO_DEF_ + 算子名大写去下划线,与发布包 opp/built-in/op_graph/inc 中已有 967 个同类隔离宏的拼法一致。位置严格贴在 REG_OP 前、OP_END_FACTORY_REG 后一行——merge_proto.py 的正则要求 guard 与 REG_OP 相邻,位置写偏宏会被丢弃。 **涉及算子(30 个)** ApplyAdagrad、BatchNormExt2、BN3DTrainingUpdate、BNInfer、BNTrainingUpdateV2、BNTrainingUpdateV3、ChamferDistance、ClippedSwiglu、CosineEmbeddingLoss、DeepNorm、DeepNormGrad、DynamicQuantUpdateScatter、DynamicQuantUpdateScatterV2、GemmaRmsNorm、GroupNormSiluQuant、HardSigmoid、HardSwishGradV2、INInferV2、InplaceApplyRMSProp、InplaceSub、InstanceNormGrad、INTrainingUpdateGrad、L2NormalizeGrad、MultiAddRmsNormDynamicQuant、MultilabelMarginLoss、NonZeroWithValue、PoissonNllLoss、Relu6Grad、SoftmaxFocalLoss、SoftmaxFocalLossGrad **顺带修复**:deep_norm、deep_norm_grad、gemma_rms_norm、multi_add_rms_norm_dynamic_quant、dynamic_quant_update_scatter_v2 这 5 个原型头文件末尾缺换行,属存量问题;pre-commit 的 end-of-file-fixer 钩子只扫改动文件,一旦改动即会被拦,故一并补齐。 **变更范围**:30 个文件,+95 −5,改动全部为条件编译指令与文件末尾换行,不改动任何 IR 的输入/输出/属性/dtype 定义,无功能与支持面变化。未改动 common/inc/op_graph/op_nn_proto_extend.h——merge_proto.py 会按算子名把聚合头中的重复项去重,改它不会进入合并产物。 ## 关联的Issue 关联 Issue #5170 ## 测试 1. **合并产物验证**:对 30 个改动文件跑 python3 scripts/util/merge_proto.py,合并产物中 REG_OP 30 个、#ifndef OPS_PROTO_DEF_ 30 个,隔离宏 30/30 全部正确带出。 2. **宏名配对验证**:与发布包 cann-9.2.0/opp/built-in/op_graph/inc/*.h 中同名算子的既有隔离宏逐个比对,宏名不一致项 0 处。 3. **重名检查**:30 个新增宏在三仓范围内无跨文件重名,每个文件内 OPS_PROTO_DEF_ 宏数恰为 1(无嵌套/重复保护)。 4. **格式与合规门禁**:按 .pre-commit-config.yaml 逐钩子本地复现 —— clang-format 18.1.8 --style=file --dry-run -Werror 整文件检查 30/30 通过、OAT 许可头 30/30 合规、trailing-whitespace / end-of-file-fixer / check-merge-conflict / detect-private-key / check-added-large-files 全部通过。 ## 文档更新 无。本 PR 不涉及文档变更。 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 <!-- 关联 Issue: https://gitcode.com/cann/ops-nn/issues/5170 --> See merge request: cann/ops-nn!9218 | 10 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 5 天前 | |
MicroAPI namespace to Reg for arch35 kernels Co-authored-by: gcw_DS4cmz2b<1312925094@qq.com> # message auto-generated for no-merge-commit merge: !9267 merge rename into master MicroAPI namespace to Reg for arch35 kernels Created-by: gcw_DS4cmz2b Commit-by: gcw_DS4cmz2b Merged-by: cann-robot Description: ## 描述 修改了index,activation,matmul,conv,foreach,optim,experimental,vfusion,hash这几个文件夹内的命名空间,将MicroAPI-->Reg ## 关联的Issue [多个文件夹内的算子命名空间使用的MicroAPI,应改为Reg](https://gitcode.com/cann/ops-nn/issues/5218) ## 测试 验证方法 严格按四步流程,逐算子验证: 1. Step 1:编译原始代码,保存 baseline binary .o 文件 MD5 2. Step 2:执行 MicroAPI → Reg 替换 3. Step 3:编译替换后代码,保存 after binary .o 文件 MD5 4. Step 4:对比 A_before.md5 与 B_after.md5 平台:ascend950,编译参数:--soc=ascend950 --ops=<op> -j16 验证替换前后 binary 产物 MD5 完全一致。 冒烟,代码审查均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9267 | 9 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 5 天前 | |
fix(apply_adam_v2, fused_mul_apply_momentum): 修复FP16 Cast别名冲突、跨tile事件同步、infershape对齐canndev、inplace output shape直取input Co-authored-by: handsomeRobot_SK<suke13@huawei.com> # message auto-generated for no-merge-commit merge: !9005 merge fix-adam-momentum-geir-issues into master fix(apply_adam_v2, fused_mul_apply_momentum): 修复FP16 Cast别名冲突、跨tile事件同步、infershape对齐canndev、inplace output shape直取input Created-by: handsomeRobot_SK Commit-by: handsomeRobot_SK Merged-by: cann-robot Description: PR 描述 标题: fix(apply_adam_v2, fused_mul_apply_momentum): 修复 FP16 Cast 别名冲突、跨 tile 事件同步、infershape 对齐 canndev 描述: 关联 Issue Closes #<issue_number> 修改内容 apply_adam_v2 1. 修复 FP16 in-place Cast 别名冲突 (VEC_ERROR) - 文件: op_kernel/arch35/apply_adam_v2_kernel.h - 改动: ProcessAdamFp16 和 ProcessMbartAdamFp16 中,用 B4 作为 FP16 中转缓冲,改为逐输入 CopyIn→B4(FP16)→Cast→B{target}(FP32) 模式,确保 Cast 的 src (B4) 和 dst (B{target}) 在不同 TBuf 上,消除别名冲突 - 新增: Process() 中 fetch evVtoMTE2 事件,前 3 个输入完成后通过 SetFlag/WaitFlag(V_MTE2) 释放 B4 供下一个输入复用 - 不变: Cast back (FP32→FP16) 保持 in-place(narrowing 安全) 2. output 名称对齐 canndev - 文件: op_host/apply_adam_v2_def.cpp - 改动: output 从 var_out/m_out/v_out 改为 var/m/v 3. infershape 对齐 canndev - 文件: op_host/apply_adam_v2_infershape.cpp - 改动: 从 InferShape4Elewise 改为内联实现 InferShape4InIdxAndOutVector 逻辑(output0,1,2 = input0 shape),包含 canndev 的 input shape 校验逻辑 4. tiling output shape 直取 input - 文件: op_host/arch35/apply_adam_v2_tiling_arch35.cpp - 改动: output shape 不再从 ctx_->GetOutputShape 读取,直接用 raw_input_shapes_[i](inplace 语义保证 outputi = inputi),绕过 GEIR infershape 推导问题 5. README 补充约束 - GEIR 模式不支持 -1/-2 动态 shape(canndev infershape 限制) fused_mul_apply_momentum 1. 修复 FP16 跨 tile V_MTE2 事件死锁 - 文件: op_kernel/arch35/fused_mul_apply_momentum_kernel.h - 改动: ProcessTile 结尾对 FP16 路径补上 SetFlag(V_MTE2),与下一 tile 开头的 WaitFlag(V_MTE2) 配对 - 影响范围: 仅 FP16 路径(if constexpr (IS_FP16)),FP32 不受影响 2. infershape 对齐 canndev - 文件: op_host/fused_mul_apply_momentum_infershape.cpp - 改动: 从 InferShape4Elewise 改为内联实现 InferShape4InIdxAndOutVector 逻辑(output0,1 = input0 shape) 3. tiling output shape 直取 input - 文件: op_host/arch35/fused_mul_apply_momentum_tiling_arch35.cpp - 改动: 同 apply_adam_v2,output shape 直取 rawInputShapes_[i] 4. def 补充 use_locking 属性 - 文件: op_host/fused_mul_apply_momentum_def.cpp - 改动: 添加 this->Attr("use_locking").AttrType(OPTIONAL).Bool(false) 5. README 补充约束 - 同 apply_adam_v2 验证 - ApplyAdamV2 L0_004 (FP32, mbart_adam): Kernel 模式 PASS - FusedMulApplyMomentum L0_001 (FP16, standard): Kernel 模式 PASS(修复死锁后) - GEIR 模式: 非 -1/-2 shape 场景 inplace 检查通过;-1/-2 场景受 canndev infershape 限制不支持(README 已说明) See merge request: cann/ops-nn!9005 | 15 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 5 天前 | |
AIDD扫描语义问题修改 Co-authored-by: y60124828<yanglou1@h-partners.com> # message auto-generated for no-merge-commit merge: !9352 merge master into master AIDD扫描语义问题修改 Created-by: yanglu-1 Commit-by: y60124828 Merged-by: cann-robot Description: ## 描述 AIDD扫描语义问题修改 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9352 | 8 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 8 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 7 天前 | |
feat(optim): add ApplyCamePart2 operator Co-authored-by: handsomeRobot_SK<suke13@huawei.com> # message auto-generated for no-merge-commit merge: !9121 merge apply_came_part2 into master feat(optim): add ApplyCamePart2 operator Created-by: handsomeRobot_SK Commit-by: handsomeRobot_SK Merged-by: cann-robot Description: ## PR: feat(optim): add ApplyCamePart2 operator ### 概述 新增 ApplyCamePart2 算子,实现 CAME 优化器 4-Part 拆分的第二部分(Part2)。在 Part1 已计算出 grad 的行/列/总和统计(sum_grad_r、sum_grad_c、sum_grad_rc)后,本算子对上一 step 的行/列二阶矩估计 r、c 做 EMA 更新,并用置信度归一化计算归一化更新方向 u,同时累加 u 的平方和 sum_square_u 供 Part3 继续消费。算子基于 Ascend C 开发,支持 Ascend950 (arch35) 平台,仅支持 GEIR 图模式调用。 CAME 优化器分四个 Part 串行执行:本算子为第二部分,完成 r/c 二阶矩 EMA 更新与归一化更新方向 u 的计算;与 ApplyCamePart1(梯度统计)、ApplyCamePart3(裁剪 + 一阶矩)、ApplyCamePart4(参数更新)配套使用。其中 r、c 为原地(in-place)更新。 ### 算子功能 实现 CAME 优化器 Part2 阶段的计算公式(对齐 kernel 实现): $$ \begin{aligned} r_{\text{out}} &= \beta_2 \cdot r + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_r}}{M} \\ c_{\text{out}} &= \beta_2 \cdot c + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_c}}{N} \\ \text{denom} &= \beta_2 \cdot \frac{\text{sum\_r}}{N} + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_rc}}{M \cdot N} \\ u &= \frac{\text{grad}}{\sqrt{r_{\text{out}} \cdot c_{\text{out}} \,/\, \text{denom}}} \\ \text{sum\_square\_u} &= \sum (u \odot u) \end{aligned} $$ 其中 $N=\text{grad.shape}[0]$ 为行数、$M=\text{grad.shape}[1]$ 为列数,$r_{\text{out}}$ 按行广播、$c_{\text{out}}$ 按列广播,$\text{sum\_r}$ 缺省时由算子内部计算 $\sum r$,$\text{global\_shape}$ 缺省时取 grad 的 $[N, M]$。 **关键特性**: - **In-place 更新**:r/c 输出与输入同名共享 GM 地址,框架将同一 GM 地址传给 kernel 的输入/输出参数,kernel 先读输入再写输出,并在 SyncAll 后读取更新值,原地语义正确 - **三阶段串行流水线**:Kernel 分 ProcessR(行二阶矩 EMA)→ ProcessC(列二阶矩 EMA)→ ProcessU(归一化方向 + 平方和)三阶段串行执行,阶段间通过 SyncAll 全核同步保证数据一致性 - **Pre/Post 辅助核**:Pre 阶段(sum_r 缺省时触发)分块计算 $\sum r$ 并通过 AtomicAdd 写入 workspace;Post 阶段由 core0 跨核归约 sum_square_u - **TypicalNet 优化**:对常见网络 shape(1024×1024、1024×4096、4096×1024、116736×1024)使用专用 TilingKey(201-203)和精简 kernel 路径 - **多 dtype 支持**:grad/r/c 支持 FP16/FP32/BF16;u/sum_square_u 强制 FP32 保精度;FP16/BF16 路径使用 ApplyCamePart2Float16 专用类 ### 对标竞品 | 竞品 | 接口 | 说明 | |------|------|------| | PyTorch | came_pytorch CAME optimizer | 功能对标,PyTorch 在 Python 层实现单阶段融合 | | NumPy | CPU 参考实现 | 功能对标,CANN 拆分为 4-Part 串行 | ### 支持规格 | 项目 | 支持情况 | |------|---------| | **数据类型** | float16, float32, bfloat16(grad/r/c);float32(u/sum_square_u/sum_grad_r/c/rc/beta2/sum_r);int64(global_shape) | | **数据格式** | ND | | **平台** | Ascend950 (arch35)、Atlas A3 训练/推理系列、Atlas A2 训练/推理系列 | | **调用模式** | GEIR 图模式 | | **输入端口** | 9 个(7 REQUIRED: grad, sum_grad_r, sum_grad_c, sum_grad_rc, r, c, beta2;2 OPTIONAL: sum_r, global_shape) | | **输出端口** | 4 个(r, c, u, sum_square_u;r/c 原地更新) | | **维度** | 仅支持 2D grad(rank=2,shape=[N, M]) | ### 交付件清单 optim/apply_came_part2/ ├── CMakeLists.txt # 构建配置 ├── README.md # 算子说明文档 ├── examples/ │ ├── test_geir_apply_came_part2.cpp # GEIR 图模式调用示例 │ └── arch35/ │ ├── test_geir_apply_came_part2.cpp # GEIR 静态数值校验 │ └── test_geir_apply_came_part2_dynamic.cpp # GEIR 动态 shape 校验 ├── op_graph/ │ ├── apply_came_part2_proto.h # GE IR 原型定义(9输入4输出,r/c同名原地) │ └── apply_came_part2_graph_infer.cpp # 图模式 InferDataType ├── op_host/ │ ├── apply_came_part2_def.cpp # 算子定义(7+2输入4输出) │ ├── apply_came_part2_infershape.cpp # 形状推导(u=grad.shape, r/c=输入shape) │ └── arch35/ │ ├── apply_came_part2_tiling_arch35.h # Tiling 数据结构 + CompileInfo │ └── apply_came_part2_tiling_arch35.cpp # Tiling 计算(596行) ├── op_kernel/ │ ├── apply_came_part2.cpp # Kernel 入口(6 TilingKey 分发 + Pre/Post) │ └── arch35/ │ ├── apply_came_part2.h # 通用 Kernel 类声明(976行实现) │ ├── apply_came_part2_common.h # 公共常量与工具函数 │ ├── apply_came_part2_pre.h # Pre 阶段:sum_r 计算 │ ├── apply_came_part2_post.h # Post 阶段:sum_square_u 跨核归约 │ ├── apply_came_part2_float16.h # FP16/BF16 专用 Kernel │ ├── apply_came_part2_typical_net.h # TypicalNet 专用 Kernel(float) │ └── apply_came_part2_float16_typical_net.h # TypicalNet 专用 Kernel(fp16/bf16) └── tests/ut/op_host/ ├── test_apply_came_part2_infershape.cpp # InferShape UT └── arch35/ └── test_apply_came_part2_tiling.cpp # Tiling UT ### 测试验证 #### 单元测试 (UT) - **覆盖范围**:InferShape + Tiling - **状态**:已交付 - **InferShape UT**:grad rank 校验、shape copy 正确性 - **Tiling UT**:形状校验、多核切分、TypicalNet 检测、Workspace 分配 #### GEIR 端对端验证 - **状态**:已交付 - **静态数值校验**:构图运行并与 CPU golden 逐值比对 r/c/u/sum_square_u - **动态 shape 校验**:动态维度(-1)与动态 rank(-2)多组 shape 校验 - **覆盖范围**: - 数据类型:FP32 / FP16 / BF16 - 形状组合:常规 shape + TypicalNet shape - 特殊场景:空 Tensor(N=0 或 M=0)、可选输入 sum_r/global_shape 缺省 ### 代码质量 - ✅ 文件头格式统一(Copyright 注释块) - ✅ Tiling 校验使用 OP_LOGE/VECTOR_INNER_ERR_REPORT 统一日志格式(rank/shape/dtype 三级校验) - ✅ 魔鬼数字常量化(BLOCK_SIZE=32, CALC_SIZE=256, CACHE_LINE=512, NUM_SCALAR_IN_UB=7) - ✅ InferShape 使用 OP_CHECK_NULL_WITH_CONTEXT + OP_CHECK_IF 格式 - ✅ InferDataType 支持图模式注册 - ✅ Kernel 三阶段流水线 + SyncAll 全核同步保证数据一致性 - ✅ In-place r/c 更新语义正确(先读后写 + SyncAll 后再读) - ✅ TypicalNet 优化路径覆盖 4 组常见 shape - ✅ 单元测试已交付(InferShape UT + Tiling UT) - ✅ GEIR 端对端示例已交付(静态 + 动态 shape) ### 编译验证 bash cd ops-nn bash build.sh --soc=ascend950 --pkg --ops=apply_came_part2 -j 256 # 预期输出 ✅ 编译成功 ✅ 生成算子包:cann-ops-nn-custom_linux-x86_64.run ### 关键实现细节 #### 1. 算子接口 | 参数 | 类型 | 说明 | |:-----|:-----|:-----| | INPUT grad | Tensor (REQUIRED) | 梯度,二维张量 [N, M],fp16/fp32/bf16 | | INPUT sum_grad_r | Tensor (REQUIRED) | grad 按行求和,shape [N],fp32 | | INPUT sum_grad_c | Tensor (REQUIRED) | grad 按列求和,shape [M],fp32 | | INPUT sum_grad_rc | Tensor (REQUIRED) | grad 全体元素之和,shape [1],fp32 | | INPUT r | Tensor (REQUIRED) | 行二阶矩估计,shape [N],fp16/fp32/bf16 | | INPUT c | Tensor (REQUIRED) | 列二阶矩估计,shape [M],fp16/fp32/bf16 | | INPUT beta2 | Tensor (REQUIRED) | 二阶矩衰减系数,标量 shape [1],fp32 | | OPTIONAL_INPUT sum_r | Tensor (OPTIONAL) | r 的全体元素之和,shape [1],fp32 | | OPTIONAL_INPUT global_shape | Tensor (OPTIONAL) | 原始 [N, M],shape [2],int64 | | OUTPUT r | Tensor (REQUIRED) | 更新后的行二阶矩,shape [N],原地更新 | | OUTPUT c | Tensor (REQUIRED) | 更新后的列二阶矩,shape [M],原地更新 | | OUTPUT u | Tensor (REQUIRED) | 归一化更新方向,shape = grad.shape,强制 fp32 | | OUTPUT sum_square_u | Tensor (REQUIRED) | u 的平方和,shape [1],fp32 | #### 2. Kernel 实现 - **架构**:三阶段串行流水线(ProcessR → ProcessC → ProcessU)+ Pre/Post 辅助核 - **TilingKey 分发**:6 个 Key(101-103 通用路径,201-203 TypicalNet 路径),通过 TILING_KEY_IS 宏分发 - **ProcessR**:行二阶矩 EMA 更新,r_out = beta2*r + (1-beta2)*sum_grad_r/M(Muls + Axpy) - **ProcessC**:列二阶矩 EMA 更新,c_out = beta2*c + (1-beta2)*sum_grad_c/N(Muls + Axpy) - **ProcessU**: 1. 计算 denom = beta2*sum_r/N + (1-beta2)*sum_grad_rc/(M*N) 2. CopyInUr/CopyInUc:加载更新后的 r/c 3. CopyInGrad:分块加载 grad 4. BroadcastR → TransposeR(ConfusionTranspose) → MulRC(r*c) → Muls(rcCoefficient) → Sqrt → Div(grad/sqrt) → Mul(u*u) → ReduceSumU 5. CopyOutU:写 u 到 GM + 写 per-core sum_square_u 到 workspace #### 3. 精度策略 - **FP32**:原生计算,无转换 - **FP16/BF16**:r/c 更新使用原生 dtype(Muls/Axpy 支持);u 计算在 ApplyCamePart2Float16 类中使用 Cast→FP32 计算→u 强制 fp32 输出 #### 4. Tiling 实现 - **形状校验**:grad rank==2;r/c/sum_grad_r/sum_grad_c/sum_grad_rc rank==1;shape 一致性;dtype 一致性 - **Tiling4CalcR**:按 N 切分多核,UB 空间按 N/(N+M) 比例分配,对齐 32B - **Tiling4CalcC**:按 M 切分多核,UB 空间按 M/(N+M) 比例分配,对齐 32B - **Tiling4CalcRc**:复用 r 切分,行方向按 CALC_SIZE/4 切分,列方向按 CALC_SIZE 切分 - **TypicalNet**:4 组 shape(1024×1024 等)使用 128 对齐 + 全列加载优化 - **Workspace**:sysWorkspace(16MB) + sumRWorkspace(512B) + sumSquareUWorkspace(核数×loop 数,512B 对齐) #### 5. In-place 优化 - r/c 输出与输入同名,框架保证 GM 地址一致 - Kernel ProcessR/ProcessC 先读输入 r/c 再写输出 r_out/c_out - SyncAll 后 ProcessU 从 rOutGm_/cOutGm_ 读取更新后的值 - Proto 定义中 INPUT r/c 与 OUTPUT r/c 同名,实现原地语义 ### 依赖与限制 - **依赖**:CANN 9.0.0 - **配套算子**:ApplyCamePart1(梯度统计)、ApplyCamePart3(裁剪 + 一阶矩)、ApplyCamePart4(参数更新) - **限制**: - 仅支持 GEIR 图模式(无 ACLNN 接口) - 仅支持 Ascend950 (arch35) - 仅支持 2D grad(rank=2,shape=[N, M]) - grad/r/c 三者 dtype 必须一致 - r/c 为原地输出 - 支持空 Tensor(N=0 或 M=0 时返回空结果,不报错) - 支持可选输入 sum_r(缺省时内部计算)和 global_shape(缺省时取 grad shape) ### Checklist - [x] 代码符合 ops-nn 内置算子标准 - [x] 文件头格式统一 - [x] Tiling 校验规范化(rank/shape/dtype 三级) - [x] clang-format 格式化 - [x] InferShape 支持 rank 校验 - [x] InferDataType 支持图模式注册 - [x] Kernel 三阶段流水线 + SyncAll 同步 - [x] In-place r/c 更新语义正确 - [x] TypicalNet 优化路径 - [x] 单元测试通过(InferShape UT + Tiling UT) - [x] GEIR 端对端验证通过(静态 + 动态 shape) - [x] README 文档完整 - [ ] 编译安装验证通过(待验证) See merge request: cann/ops-nn!9121 | 5 天前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 7 天前 | |
feat: 新增 ApplyCamePart4 算子 Co-authored-by: tianqiguang<tianqiguang@huawei.com> # message auto-generated for no-merge-commit merge: !9123 merge master into master feat: 新增 ApplyCamePart4 算子 Created-by: tianqiguang Commit-by: tianqiguang Merged-by: cann-robot Description: ## 描述 新增 ApplyCamePart4 算子,用于 CAME 优化器第 4 段(参数更新段)。 输入待更新参数 param_in、一阶动量 m(形状 (N,M))与置信因子 r_in(N)、c_in(M),按 CAME 更新规则回写 param_out、r_out、c_out。sum_r(全 N 行 r_in 的归约和)与 global_shape(全局 N,M)为可选输入:分布式场景由前序算子/全局形状传入;单机场景缺省,kernel 内部完成归约并取本地 n/m。 - 数据类型:param_in/m/r_in/c_in 及输出 param_out/r_out/c_out 支持 FLOAT/FLOAT16/BFLOAT16;weight_decay/lr/beta3/sum_r/sum_u_r/sum_u_c/sum_u_rc 恒为 FLOAT;global_shape 为 INT64。 - 数据格式:全部 ND。 - 无属性(attr);weight_decay/lr/beta3 等标量均作为输入传入。 - 平台:Ascend 950PR/Ascend 950DT(arch35,本仓 vendor 包);Atlas A2 系列由 canndev 内置 ascendc 实现支持。 ## 关联的Issue - #5176 ## 测试 - 新增 tiling 单测:tests/ut/op_host/arch35/test_apply_came_part4_tiling.cpp - 新增 infershape 单测:tests/ut/op_host/test_apply_came_part4_infershape.cpp - 新增 golden 数据:tests/assets/golden.py - 新增图模式调用样例:examples/test_geir_apply_came_part4.cpp ## 文档更新 - 新增算子 README:optim/apply_came_part4/README.md - 更新算子清单:docs/zh/op_list.md ## 类型标签 - [x] 新特性 ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!9123 | 9 天前 | |
fix(docs): 修正 Softsign/ApplyCenteredRMSProp/BNInferGrad 产品支持表 Atlas 200I/500 A2 标记 Co-authored-by: lianjieyu<yulianjie@huawei.com> # message auto-generated for no-merge-commit merge: !9336 merge fix_doc into master fix(docs): 修正 Softsign/ApplyCenteredRMSProp/BNInferGrad 产品支持表 Atlas 200I/500 A2 标记 Created-by: lianjieyu Commit-by: lianjieyu Merged-by: cann-robot Description: ## 修复内容 修正 3 个算子 README.md「产品支持情况」表中 **Atlas 200I/500 A2 推理产品** 的支持标记错误(× → √): | 算子 | 文件 | 修改前 | 修改后 | |---|---|---|---| | Softsign | activation/softsign/README.md | × | √ | | ApplyCenteredRMSProp | optim/apply_centered_rms_prop/README.md | × | √ | | BNInferGrad | norm/bn_infer_grad/README.md | × | √ | ## 修复依据 以 canndev 仓 ini 为产品支持判据(Ascend 950PR/DT 按规则默认支持,其余系列以 ini 实际注册为准)。 在 canndev/ops/built-in/tbe/op_info_cfg/ai_core/ascend310b/aic-ascend310b-ops-info.ini 中检索到上述三算子均已注册: - [Softsign] input0.dtype=float16,float - [ApplyCenteredRMSProp] dynamicShapeSupport.flag=true - [BNInferGrad] compute.cost=10 「Atlas 200I/500 A2 推理产品」对应 Ascend 310B 系列(Ascend310B1/B2/B3/B4),即 ascend310b ini。因此三算子在该产品实际可用,README 应标记为 √。 ## 不在本次修改范围 - **SeluGrad**:ascend310b ini 中未注册 [SeluGrad],其 README「×」标记正确,保持不变。 - 其余产品行(950PR/DT、A3、A2、推理系列、训练系列)均与 ini 一致,无需改动。 ## 变更清单 - activation/softsign/README.md - optim/apply_centered_rms_prop/README.md - norm/bn_infer_grad/README.md Fixes #5244 See merge request: cann/ops-nn!9336 | 8 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
[CANNBot] apply_ftrl_v2算子增加异常拦截校验 Co-authored-by: chen_chenn<chenchen167@huawei.com> # message auto-generated for no-merge-commit merge: !8371 merge ApplyFtrlV2 into master [CANNBot] apply_ftrl_v2算子增加异常拦截校验 Created-by: chen_chenn Commit-by: chen_chenn Merged-by: cann-robot Description: ## 描述 apply_ftrl_v2算子增加异常拦截校验 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4828 ## 测试 TTK ## 文档更新 不涉及 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!8371 | 19 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 8 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
[CANNBot] 修复apply_keras_momentum标量输入时shape(var)!=shape(accum)的tiling报错 Co-authored-by: chen_chenn<chenchen167@huawei.com> # message auto-generated for no-merge-commit merge: !8913 merge fix_applyKerasMomentum into master [CANNBot] 修复apply_keras_momentum标量输入时shape(var)!=shape(accum)的tiling报错 Created-by: chen_chenn Commit-by: chen_chenn Merged-by: cann-robot Description: ## 描述 修复apply_keras_momentum标量输入时shape(var)!=shape(accum)的tiling报错 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4914 ## 测试 TTK ## 文档更新 不涉及 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!8913 | 16 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
add_ops_fused_adamw Co-authored-by: jisongyuan<jisongyuan@h-partners.com> # message auto-generated for no-merge-commit merge: !7851 merge master into master add_ops_fused_adamw Created-by: ji-songyuan Commit-by: jisongyuan Merged-by: cann-robot Description: ## 描述 新增融合优化器算子 fused_adamw,提升大规模参数更新性能 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 1. 功能概述 本次PR为ops-nn算子库新增了融合优化器算子的aclnn接口 aclnnFusedAdamw和融合算子fused_adamw。该算子将AdamW优化器的多个计算内核(如梯度更新、一阶/二阶矩估计、权重衰减等)融合为单个kernel内核,旨在减少内存访问次数和内核启动开销,为大规模深度学习模型的训练提供更高效的参数更新能力。 2. 计算公式 corr1 = 1 - β1ᵗ corr2 = 1 - β2ᵗ m_new = β1 * m + (1 - β1) * grad v_new = β2 * v + (1 - β2) * (grad * grad) m_hat = m_new / corr1 v_hat = v_new / corr2 denom = sqrt(v_hat) + eps param_new = param - lr * ( m_hat / denom + weight_decay * param ) 3. 输入输出  ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> [#4847](https://gitcode.com/cann/ops-nn/issues/4847) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 泛化case测试500 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> optim/fused_adamw/README.md optim/fused_adamw/docs/aclnnFusedAdamw.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7851 | 18 天前 | |
feat: add verification on FusedMulApplyKerasMomentum Co-authored-by: niukang_hw<niukang1@huawei.com> # message auto-generated for no-merge-commit merge: !8268 merge dev_fused_mul_apply_keras_momentum into master feat: add verification on FusedMulApplyKerasMomentum Created-by: niukang_hw Commit-by: niukang_hw Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8268 | 1 个月前 | |
fix(proto): 统一 OPS_PROTO_DEF 去重宏保护格式 Co-authored-by: Coder_Nerd<shishuai5@huawei.com> # message auto-generated for no-merge-commit merge: !9265 merge docs/heaviside-op-api-support into master fix(proto): 统一 OPS_PROTO_DEF 去重宏保护格式 Created-by: Coder_Nerd Commit-by: Coder_Nerd Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 补充去重宏(2 个算子): - norm/bn_infer_grad:BNInferGrad 补充 OPS_PROTO_DEF_BNINFERGRAD - optim/fused_mul_apply_momentum:FusedMulApplyMomentum 补充 OPS_PROTO_DEF_FUSEDMULAPPLYMOMENTUM 清理格式(3 个算子): - quant/act_ulq_clamp_max_grad:移除去重宏内多余空行 - quant/act_ulq_clamp_min_grad:移除去重宏内多余空行 - quant/acts_ulq_input_grad:移除去重宏内多余空行 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5193 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9265 | 9 天前 | |
fix: align fused_mul_apply_momentum_extern parameter types with canndev and drop BF16 support Co-authored-by: niukang_hw<niukang1@huawei.com> # message auto-generated for no-merge-commit merge: !9189 merge master into master fix: align fused_mul_apply_momentum_extern parameter types with canndev and drop BF16 support Created-by: niukang_hw Commit-by: niukang_hw Merged-by: cann-robot Description: ## 描述 在 TTK 的 GEIR 模式测试中,算子 fused_mul_apply_momentum_extern 出现类型错误。 #### 问题现象 测试报错:The op do not support thr dtype: DT_BFLOAT16 表明该算子当前无法处理 BF16(bfloat16)数据类型输入。 #### 根因定位 Kernel 层面:该算子的 kernel 实现中已包含对 BF16 类型的支持。 Proto/注册层面:算子的 Proto 定义(或 REG_OP 参数类型声明)中并未包含 BF16 类型,导致类型检查失败。 对齐要求:该 Proto 定义必须与上游 canndev 仓库保持一致。而 canndev 中该算子不支持 BF16,因此不能独立添加 BF16 支持。 #### 修改方案 fused_mul_apply_momentum_extern 算子删除所有 BF16 相关代码。 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5132 需求开发pr: https://gitcode.com/cann/ops-nn/pull/7533 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> #### 测试环境 - 平台:Ascend950PR (arch35, DAV_3510) - CANN:9.0.0 - TTK:ops-test-kit v3.0.0 - 用例总数:100 条 #### 按输入 dtype × Nesterov 模式统计 | 通路 | dtype | use_nesterov | TilingKey | 用例数 | Kernel 模式 | GEIR 模式 | |------|-------|:------------:|:---------:|:------:|:-----------:|:---------:| | K0 | FP32 | false | 0 | 20 | 20/20 PASS | 20/20 PASS | | K1 | FP32 | true | 1 | 15 | 15/15 PASS | 15/15 PASS | | K2 | FP16 | false | 0 | 20 | 20/20 PASS | 20/20 PASS | | K3 | FP16 | true | 1 | 15 | 15/15 PASS | 15/15 PASS | | S | 混合 | 混合 | 0/1 | 30 | 30/30 PASS | 30/30 PASS | | **合计** | | | | **100** | **100/100 PASS** | **100/100 PASS** | #### 特殊场景覆盖(S 系列 30 条) | 场景 | 用例数 | dtype | Kernel | GEIR | |------|--------|-------|:------:|:----:| | rank 1~8 多维 shape | 8 | FP32/FP16 | 8/8 PASS | 8/8 PASS | | 对齐边界 256/512/1024 元素 | 6 | FP32/FP16 | 6/6 PASS | 6/6 PASS | | 极端值(lr=1e-5, momentum=0.999) | 4 | FP32/FP16 | 4/4 PASS | 4/4 PASS | | 正负混合数据 | 4 | FP32/FP16 | 4/4 PASS | 4/4 PASS | | NaN 传播 | 2 | FP32 | 2/2 PASS | 2/2 PASS | | Inf 传播 | 2 | FP32 | 2/2 PASS | 2/2 PASS | | 全零梯度 | 2 | FP32/FP16 | 2/2 PASS | 2/2 PASS | | use_locking=True | 2 | FP32/FP16 | 2/2 PASS | 2/2 PASS | #### 结论 **Kernel 模式:100/100 PASS(0 FAIL)** **GEIR 模式:100/100 PASS(0 FAIL)** 双通路验证全部通过,覆盖 FP32/FP16 × 标准/Nesterov 四种组合 + 30 条特殊场景用例。 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9189 | 10 天前 | |
clean_code 代码重复率整改 Co-authored-by: zhuzemao<zhuzemao1@h-partners.com> # message auto-generated for no-merge-commit merge: !8694 merge clean_code into master clean_code 代码重复率整改 Created-by: zhuzemao Commit-by: zhuzemao Merged-by: cann-robot Description: ## 描述 clean_code 代码重复率整改 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4802 ## 测试 不涉及 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8694 | 22 天前 | |
feat(optim): add InplaceApplyAdaMax operator for Ascend950 Co-authored-by: Miao_Haifeng<miaohaifeng@huawei.com> # message auto-generated for no-merge-commit merge: !8919 merge inplace_apply_ada_max_code_review into master feat(optim): add InplaceApplyAdaMax operator for Ascend950 Created-by: Almost_CANN Commit-by: Miao_Haifeng Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 功能说明 - **算子功能**:执行AdaMax优化器的单步参数更新。AdaMax是Adam优化器的变体,使用无穷范数 $L_{\infty}$ 代替二阶矩估计,对权重 var、一阶矩m、无穷范数v进行更新。输出端口名 var/m/v 与输入同名(GE inplace 别名),框架将输出内存别名到输入内存,实现原地更新。 - **计算公式**: 给定时间步 $t$ 的梯度 $g_t$,衰减系数 $\beta_1, \beta_2$,学习率 $lr$,数值稳定常数 $\epsilon$,以及外部传入的偏差校正因子 $\beta_1^t$: $$ \begin{aligned} m_{t} &= \beta_1 \cdot m_{t-1} + (1 - \beta_1) \cdot g_t \\ v_{t} &= \max(\beta_2 \cdot v_{t-1},\ |g_t|) \\ var_{t} &= var_{t-1} - \frac{lr}{1 - \beta_1^t} \cdot \frac{m_t}{v_t + \epsilon} \end{aligned} $$ 算子原型:9输入 + 3输出 (var/m/v,输出名与输入同名 = GE inplace 别名) + 1属性 (use_locking)。对齐 canndev REG_OP(ApplyAdaMaxD)。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 更新了ops-nn/docs/zh/op_list.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8919 | 12 天前 | |
MicroAPI namespace to Reg for arch35 kernels Co-authored-by: gcw_DS4cmz2b<1312925094@qq.com> # message auto-generated for no-merge-commit merge: !9267 merge rename into master MicroAPI namespace to Reg for arch35 kernels Created-by: gcw_DS4cmz2b Commit-by: gcw_DS4cmz2b Merged-by: cann-robot Description: ## 描述 修改了index,activation,matmul,conv,foreach,optim,experimental,vfusion,hash这几个文件夹内的命名空间,将MicroAPI-->Reg ## 关联的Issue [多个文件夹内的算子命名空间使用的MicroAPI,应改为Reg](https://gitcode.com/cann/ops-nn/issues/5218) ## 测试 验证方法 严格按四步流程,逐算子验证: 1. Step 1:编译原始代码,保存 baseline binary .o 文件 MD5 2. Step 2:执行 MicroAPI → Reg 替换 3. Step 3:编译替换后代码,保存 after binary .o 文件 MD5 4. Step 4:对比 A_before.md5 与 B_after.md5 平台:ascend950,编译参数:--soc=ascend950 --ops=<op> -j16 验证替换前后 binary 产物 MD5 完全一致。 冒烟,代码审查均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9267 | 9 天前 | |
修改Relu6D,InplaceApplyAdagradDA,InplaceApplyAdagradV2产品支持情况 Co-authored-by: zhongheng<m202474569@hust.edu.cn> # message auto-generated for no-merge-commit merge: !9404 merge codex/fix-readme-product-support into master 修改Relu6D,InplaceApplyAdagradDA,InplaceApplyAdagradV2产品支持情况 Created-by: zhongheng Commit-by: zhongheng Merged-by: cann-robot Description: ## 描述 复核并修正以下算子 README 中的产品支持情况: - Relu6D:支持 Ascend 950PR/Ascend 950DT、Atlas A3、Atlas A2。 - InplaceApplyAdagradDA:历史软件包中的接口名称与当前 OpType 不同,不能作为当前算子的产品支持证据;仅 Ascend 950PR/Ascend 950DT 标记为支持。 - InplaceApplyAdagradV2:历史软件包中的接口名称与当前 OpType 不同,不能作为当前算子的产品支持证据;仅 Ascend 950PR/Ascend 950DT 标记为支持。 本次仅调整 README 产品支持表中的 √/×,不修改算子实现及其他文档内容。 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5273 ## 测试 - 精确检查五个算子的六行产品表:Relu6D、SmoothL1LossGrad 为 √√√×××;两个 Inplace 算子均为 √×××××。 - 检查 PR 净 diff 仅包含 Relu6D 及两个 Inplace 算子 README 的产品支持状态变更;SmoothL1LossGrad 与目标分支一致,无净差异。 - 检查 PR 分支相对目标 master 仅包含 1 个提交。 - 执行 git diff --check,检查通过。 - 执行 README 全量格式校验;报告项均为文档原有的参数表或调用方式格式问题,本次遵循仅修改产品支持情况的范围未处理。 - 本次为纯文档修改,未执行运行时测试。 ## 文档更新 - 更新 activation/relu6_d/README.md。 - 更新 optim/inplace_apply_adagrad_da/README.md。 - 更新 optim/inplace_apply_adagrad_v2/README.md。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9404 | 8 天前 | |
修改Relu6D,InplaceApplyAdagradDA,InplaceApplyAdagradV2产品支持情况 Co-authored-by: zhongheng<m202474569@hust.edu.cn> # message auto-generated for no-merge-commit merge: !9404 merge codex/fix-readme-product-support into master 修改Relu6D,InplaceApplyAdagradDA,InplaceApplyAdagradV2产品支持情况 Created-by: zhongheng Commit-by: zhongheng Merged-by: cann-robot Description: ## 描述 复核并修正以下算子 README 中的产品支持情况: - Relu6D:支持 Ascend 950PR/Ascend 950DT、Atlas A3、Atlas A2。 - InplaceApplyAdagradDA:历史软件包中的接口名称与当前 OpType 不同,不能作为当前算子的产品支持证据;仅 Ascend 950PR/Ascend 950DT 标记为支持。 - InplaceApplyAdagradV2:历史软件包中的接口名称与当前 OpType 不同,不能作为当前算子的产品支持证据;仅 Ascend 950PR/Ascend 950DT 标记为支持。 本次仅调整 README 产品支持表中的 √/×,不修改算子实现及其他文档内容。 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5273 ## 测试 - 精确检查五个算子的六行产品表:Relu6D、SmoothL1LossGrad 为 √√√×××;两个 Inplace 算子均为 √×××××。 - 检查 PR 净 diff 仅包含 Relu6D 及两个 Inplace 算子 README 的产品支持状态变更;SmoothL1LossGrad 与目标分支一致,无净差异。 - 检查 PR 分支相对目标 master 仅包含 1 个提交。 - 执行 git diff --check,检查通过。 - 执行 README 全量格式校验;报告项均为文档原有的参数表或调用方式格式问题,本次遵循仅修改产品支持情况的范围未处理。 - 本次为纯文档修改,未执行运行时测试。 ## 文档更新 - 更新 activation/relu6_d/README.md。 - 更新 optim/inplace_apply_adagrad_da/README.md。 - 更新 optim/inplace_apply_adagrad_v2/README.md。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9404 | 8 天前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 7 天前 | |
fix: golden尊重传入dtype + kernel通用分支Power改用DOUBLE_FLOAT_TECH高精度 Co-authored-by: zhaixiao<zhaixiao1@huawei.com> # message auto-generated for no-merge-commit merge: !9601 merge fix/inplace-apply-ftrl-precision into master fix: golden尊重传入dtype + kernel通用分支Power改用DOUBLE_FLOAT_TECH高精度 Created-by: Onthetreeoh Commit-by: zhaixiao Merged-by: cann-robot Description: ## 修复内容 三方可信度修复(两处独立缺陷, 同一次三方测试发现): ### 1. golden(tests/assets/golden.py) 旧版将TTK Promote升精输入无条件 astype(fp32) 降级计算, golden退化为第二个TF竞品(|b-g|恒0), cross_check比值分母恒零, 产生大量假阳性FAIL. 新版仅fp16/bf16升fp32, fp32/fp64按传入精度计算. ### 2. kernel(op_kernel/arch35/inplace_apply_ftrl.h) ComputePow通用分支(非特判lr_power)默认INTRINSIC pow相对误差约6e-5, 在小lr的sigma放大链路上被放大~1.5e4倍, var/linear输出偏离fp64真值达5%. 改用CANN Power的DOUBLE_FLOAT_TECH(双float组合~1e-14), 两方验证L1_520/530/568/581/254五条误差型FAIL转PASS, binary执行时间持平. See merge request: cann/ops-nn!9601 | 5 天前 | |
feat: add inplace_apply_ftrl_v2 op Co-authored-by: Bright0313<liwenbo84@huawei.com> # message auto-generated for no-merge-commit merge: !8646 merge feat/inplace-apply-ftrl-v2 into master feat: add inplace_apply_ftrl_v2 op Created-by: Bright0313 Commit-by: Bright0313 Merged-by: cann-robot Description: ## 描述 新增 InplaceApplyFtrlV2 算子,FTRL-Proximal 在线学习优化算法的单步参数更新算子。支持 BFLOAT16/FLOAT16/FLOAT,仅 Ascend 950PR/DT。门禁:pre-commit PASSED, JIT/ophost UT/opgraph UT/opkernel UT 全 PASSED。 ## 关联的Issue 关联Issue #5192 ## 测试 - UT: ophost/opgraph/opkernel 全 PASSED - CI: 编译构建全部 SUCCESS ## 类型标签 - [x] 新特性 ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!8646 | 9 天前 | |
fix inplace_apply_keras_momentum 注册图模式接口修复 Co-authored-by: Davon14272<liuwenda4@huawei.com> # message auto-generated for no-merge-commit merge: !8877 merge fix/inplace-apply-keras-momentum-infer-dtype into master fix inplace_apply_keras_momentum 注册图模式接口修复 Created-by: Davon14272 Commit-by: Davon14272 Merged-by: cann-robot Description: ## 描述 这是算子安装/注册问题一算子opinfo已注册(能找到算子),但 op_proto的infer_datatype函数缺失或 .so未加 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> [#4893](https://gitcode.com/cann/ops-nn/issues/4893) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8877 | 18 天前 | |
fix: InplaceApplyMentarum FP32 path var_out accuracy exception Co-authored-by: niukang_hw<niukang1@huawei.com> # message auto-generated for no-merge-commit merge: !8566 merge dev_inplace_apply_momentum into master fix: InplaceApplyMentarum FP32 path var_out accuracy exception Created-by: niukang_hw Commit-by: niukang_hw Merged-by: cann-robot Description: ## 描述 ### 1. 问题描述 InplaceApplyMomentum 算子 FP32 dtype 下 var_out 输出精度异常。TTK 100 条白盒用例中 42 条失败(PassRate 58%),失败模式为 var_out=FAIL, accum_out=PASS。FP16/BF16 路径不受影响。多核场景(65536元素/43核)下两个输出均错误。 根因有两个: - FP32 路径将 Vector 计算结果直接从 VECIN TQue buffer 执行 DataCopyPad(MTE3),缺少 V→MTE3 同步,写出未更新的脏数据 - 标量 lr/momentum 通过黑名单 API GlobalTensor::GetValue() 直接从 GM 读取,多核并发读取导致标量值错误 ### 2. 环境信息 - NPU: Ascend950PR (DAV_3510, arch35) - CANN: 9.0.0 - 算子仓: ops-nn, optim/inplace_apply_momentum - TTK: ops-test-kit 3.0.0 ### 3. 重现步骤 bash # 1. 编译安装算子 cd <ops-nn repo> source /usr/local/Ascend/cann-9.0.0/set_env.sh bash build.sh --ops=inplace_apply_momentum --soc=ascend950 cd build_out && bash cann-ops-nn-custom_linux-x86_64.run --install-path=/usr/local/Ascend/cann-9.0.0/opp --quiet --install-for-all # 2. 运行 TTK 测试(float32, shape=(65536,), 43核) cd <ops-test-kit> python3 -m ttk kernel -i <test_csv> \ --plugin <golden_dir> \ -t iam_012 --single-log # 3. 观察结果 # DYN_GOLD: FAIL,PASS (var_out=FAIL, accum_out=PASS) # precision_metrics: mere=0.0008, mare=7.83, threshold=0.0001220703125 最小复现:var=[1.0], accum=[0.5], lr=[0.01], grad=[0.1], momentum=[0.9], dtype=float32,golden 期望 var_out=0.9945,实际 kernel 输出 var_out=0(脏数据)。 ### 4. 预期结果 100 条白盒用例全部 PASS(PassRate 100%),var_out 与 golden tf.raw_ops.ResourceApplyMomentum 在容差范围内一致(FP32 rtol=1e-4)。 ### 5. 日志 / 截图 === 修复前 === TTK Test Summary: Total=100, PASS=58, FAIL=42, PassRate=58% iam_012 (float32, shape=(65536,), 43核): out[0] (var_out): mere=0.0008, mare=7.83, th=0.000122, FAIL out[1] (accum_out): mere=0.006, mare=37.0, th=0.000122, FAIL === 修复后 === TTK Test Summary: Total=100, PASS=100, FAIL=0, PassRate=100% 修复涉及两个文件: - op_kernel/arch35/inplace_apply_momentum.h:FP32 路径新增 VECOUT TQue 输出;标量读取从 GetValue() 改为 DataCopyPad+LocalTensor.GetValue() - op_host/arch35/inplace_apply_momentum_tiling_arch35.cpp:FP32_UB_BYTES_PER_ELEM 从 16 调整为 24 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4737 ## 测试 修复后,TTK Test Summary: Total=100, PASS=100, FAIL=0, PassRate=100% ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8566 | 24 天前 | |
feat: add verification on InplaceApplyPowerSign Co-authored-by: niukang_hw<niukang1@huawei.com> # message auto-generated for no-merge-commit merge: !8262 merge dev_inplace_apply_power_sign into master feat: add verification on InplaceApplyPowerSign Created-by: niukang_hw Commit-by: niukang_hw Merged-by: cann-robot Description: ## 描述 此 PR 为 InplaceApplyPowerSign 算子的 Tiling 阶段新增了输入校验逻辑,主要包括输入张量的维度上限检查(rank ≤ 8)以及所有 7 个输入之间 dtype 一致性的校验,并添加了两个 GEIR 异常拦截测试文件来覆盖这些校验路径。 主要改动: 1、新增 CheckInputRankLimit 函数:在 inplace_apply_power_sign_tiling.cpp 中增加了对单个输入的 rank 检查,若维度数超过 8 则返回 GRAPH_FAILED,用于拦截 9 维及以上张量。 2、在 GetShapeAttrsInfo 中加入 rank 和 dtype 一致性校验:循环检查全部 7 个输入(var、m、lr、logbase、sign_decay、beta、grad)的 rank 是否超限,并增加循环校验所有输入的 dtype 是否与 var 的 dtype 一致,不一致则报错返回。 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4631 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8262 | 30 天前 | |
feat(optim): add InplaceApplyProximalAdagrad operator Co-authored-by: handsomeRobot_SK<suke13@huawei.com> # message auto-generated for no-merge-commit merge: !8332 merge inplace_apply_proximal_adagrad into master feat(optim): add InplaceApplyProximalAdagrad operator Created-by: handsomeRobot_SK Commit-by: handsomeRobot_SK Merged-by: cann-robot Description: ## PR: feat(optim): add InplaceApplyProximalAdagrad operator ### 概述 新增 InplaceApplyProximalAdagrad 算子,实现 Proximal Adagrad 优化器的参数更新(FOBOS 近端算法),结合 Adagrad 自适应学习率与 L1/L2 近端正则化,用于深度学习训练中反向传播后的参数更新阶段。算子基于 Ascend C 开发,支持 Ascend950 (arch35/DAV_3510) 平台,仅支持 GEIR 图模式调用。 基于 ApplyProximalAdagrad V1 演进,将单输出 algorithmic inplace 设计升级为**双显式 inplace 输出**(var / accum),完整反映 Proximal Adagrad 算法的 inplace 更新语义,对齐弃用版 ApplyProximalAdagradD 的双输出端口设计。 ### 算子功能 实现 Proximal Adagrad 单步参数更新(FOBOS 五步公式): $$ \begin{aligned} \text{accum}_t &= \text{accum}_{t-1} + \text{grad}_t^2 \\ \eta_t &= \frac{\text{lr}}{\sqrt{\text{accum}_t}} \\ \text{prox}_t &= \text{var}_{t-1} - \eta_t \cdot \text{grad}_t \\ \text{var}_t &= \frac{\text{sign}(\text{prox}_t)}{1 + \eta_t \cdot \text{l2}} \cdot \max\!\left(|\text{prox}_t| - \eta_t \cdot \text{l1},\ 0\right) \end{aligned} $$ 当 L1 = 0 时简化为: $$ \text{var}_t = \frac{\text{prox}_t}{1 + \eta_t \cdot \text{l2}} $$ 其中 $var$ 为模型参数,$accum$ 为梯度平方累积量,$lr$ 为学习率,$l1/l2$ 为正则化强度,$grad$ 为当前梯度。 **关键特性**: - **L1 软阈值产生稀疏性**:当 $|prox| \leq \eta \cdot l1$ 时权重直接置零,适用于需要稀疏模型的场景 - **Adagrad 自适应学习率**:对低频特征使用更大学习率,适合稀疏特征训练 - **Inplace 语义**:var/accum 均原地更新,V2 将两者显式暴露为输出端口 - **L1=0 双层快速路径**:编译期 HAS_L1 + 运行时 l1==0 双层优化,跳过 sign/软阈值计算 - **FP16/BF16 Cast up**:半精度输入内部 Cast 到 FP32 计算,结果 Cast 回原始精度 ### 对标竞品 | 竞品 | 接口 | 说明 | |------|------|------| | TensorFlow | tf.raw_ops.ApplyProximalAdagrad | 功能对标,CANN 显式暴露 var/accum 双输出 | | PyTorch | 无原生实现 | PyTorch 优化器在 Python 层实现,不在 ATen 注册 | ### 支持规格 | 项目 | 支持情况 | |------|---------| | **数据类型** | float16, float32, bfloat16 | | **数据格式** | ND | | **平台** | Ascend950 (arch35) | | **调用模式** | GEIR 图模式 | | **输出端口** | 2 个显式 inplace 输出 (var + accum) | | **TensorFlow 兼容** | 对标 ApplyProximalAdagrad / ResourceApplyProximalAdagrad | ### 交付件清单 optim/inplace_apply_proximal_adagrad/ ├── CMakeLists.txt # 构建配置 ├── README.md # 算子文档 ├── examples/ │ ├── test_geir_inplace_apply_proximal_adagrad.cpp # GEIR 示例 │ └── arch35/ │ └── test_geir_inplace_apply_proximal_adagrad.cpp # arch35 GEIR 示例 ├── op_graph/ │ ├── CMakeLists.txt │ ├── inplace_apply_proximal_adagrad_proto.h # GEIR 原型定义 │ └── inplace_apply_proximal_adagrad_graph_infer.cpp # 图模式 InferDataType ├── op_host/ │ ├── inplace_apply_proximal_adagrad_def.cpp # 算子定义(6输入2输出) │ ├── inplace_apply_proximal_adagrad_infershape.cpp # 形状推导(含accum输出) │ └── arch35/ │ ├── inplace_apply_proximal_adagrad_tiling_arch35.h # Tiling 类声明 │ └── inplace_apply_proximal_adagrad_tiling_arch35.cpp # Tiling 计算 ├── op_kernel/ │ ├── inplace_apply_proximal_adagrad.cpp # Kernel 入口(8参数含accum_out) │ └── arch35/ │ ├── inplace_apply_proximal_adagrad.h # Kernel 实现(计算逻辑零改动复用V1) │ ├── inplace_apply_proximal_adagrad_struct.h # 模板参数声明 │ └── inplace_apply_proximal_adagrad_tiling_data.h # Tiling 数据结构 └── tests/ └── ut/ └── op_host/ ├── test_inplace_apply_proximal_adagrad_infershape.cpp # InferShape UT └── arch35/ └── test_inplace_apply_proximal_adagrad_tiling_arch35.cpp # Tiling UT ### 测试验证 #### 单元测试 (UT) - **覆盖范围**:InferShape + Tiling - **通过率**:100% #### GEIR 端对端验证 - **状态**:✅ 通过 - **验证内容**:图编译 + 图执行 + 输出正确性 - **精度标准**:商用标准(双标杆 Ratio),L0 级(MARE Ratio≤10) - **Golden 标杆**:TensorFlow tf.raw_ops.ResourceApplyProximalAdagrad - **覆盖范围**: - 数据类型:FP32 / FP16 / BF16 - L1 强度:0(快速路径)/ 非0(稀疏路径) - 特殊场景:空 Tensor、大 shape、标量输入 ### 代码质量 - ✅ 文件头格式统一(Copyright + Generated By CANNBot) - ✅ Tiling 校验使用 OP_LOGE 统一日志格式 - ✅ 算子定义属性添加 AttrType(OPTIONAL) 与原型对齐 - ✅ dtype 校验改用 OP_CHECK_IF + OP_LOGE 格式 - ✅ 魔鬼数字常量化(kVecRegBytes, kAlignBytes, kPadVarGrad, kPadAccum 等) - ✅ Kernel 计算逻辑 100% 复用 ApplyProximalAdagrad V1,零改动 - ✅ Tiling 策略 100% 复用 ApplyProximalAdagrad V1,零改动 - ✅ clang-format 格式化 ### 编译验证 bash cd ops-nn bash build.sh --soc=ascend950 --pkg --ops=inplace_apply_proximal_adagrad -j16 # 输出 ✅ 编译成功 ✅ 生成算子包:cann-ops-nn-custom_linux-x86_64.run ### 关键实现细节 #### 1. 版本关系 | 版本 | 算子名 | 输出端口 | Kernel 实现 | 状态 | |------|--------|---------|------------|------| | 弃用版 | ApplyProximalAdagradD | 2 | TBE (Python) | DEPRECATED | | V1 | ApplyProximalAdagrad | 1 | Ascend C (C++) | 推荐使用 | | **V2(本次)** | **InplaceApplyProximalAdagrad** | **2** | **Ascend C(复用V1)** | **本次交付** | #### 2. Kernel 实现 - **架构**:TQue 双缓冲 + TBuf scratch,完全复用 ApplyProximalAdagrad V1 - **模板参数**:(D_T_VAR, PAD_TAIL, HAS_L1),3 dtype × 2 pad × 2 L1 = 12 变体 - **五步公式**: 1. accum' = accum + grad² 2. eta = lr * rsqrt(accum') 3. prox = var - eta * grad 4. (l1>0) 软阈值: sign(prox) * max(|prox|-eta*l1, 0); (l1=0) 跳过 5. var' = prox_hat / (1 + eta*l2) #### 3. 精度策略 - **FP32**:原生计算,无转换 - **FP16**:Cast→FP32 计算→Cast 回(CAST_RINT) - **BF16**:Cast→FP32 计算→Cast 回(CAST_ROUND),标量加载走 Vector Cast workaround #### 4. Tiling 实现 - **多核切分**:blockFactor = CeilAlign(CeilDiv(total, coreNum), ubBlockSize) - **UB 切分**:按 co-resident buffer 占用计算 ubFactor - **TilingKey**:(dType, padTail, hasL1),默认 hasL1=1(标量在 GM 不可 host 读取) #### 5. 尾部 Padding - **var / grad**:pad 0,grad=0 保持 accum 不变 - **accum**:pad 1,Rsqrt(1)=1 避免 +Inf→NaN ### 依赖与限制 - **依赖**:CANN 9.0.0 - **限制**: - 仅支持 GEIR 图模式(无 ACLNN 接口) - 仅支持 Ascend950 (arch35) - var、accum、grad 三者 shape/dtype 必须完全一致 - lr、l1、l2 为 0-D 或 1-element 标量 - 不支持空 Tensor(0 元素) - use_locking 属性为 TensorFlow 兼容保留 ### Checklist - [x] 代码符合 ops-nn 内置算子标准 - [x] 文件头格式统一 - [x] Tiling 校验规范化(OP_LOGE + OP_CHECK_IF) - [x] 单元测试通过 - [x] GEIR 端对端验证通过 - [x] 编译安装验证通过 - [x] 文档完整(README + 示例) - [x] clang-format 格式化 - [x] Kernel 计算逻辑复用 V1(零改动) - [x] Tiling 策略复用 V1(零改动) See merge request: cann/ops-nn!8332 | 23 天前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 7 天前 | |
foreach/lamb/scatter类部分算子补齐A5输入校验和资料说明 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !7419 merge master into master foreach/lamb/scatter类部分算子补齐A5输入校验和资料说明 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 foreach/lamb/scatter类部分算子资料描述不清晰,补齐A5输入校验和资料说明 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4075 ## 测试 不涉及 ## 文档更新 foreach/lamb/scatter类部分算子README文件 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!7419 | 1 个月前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9616 merge fix/infer-datatype-missing into master fix(op_host): 10 个算子补齐缺失的 InferDataType 注册 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 ### 问题 Relu6Grad、LambApplyOptimizerAssign、LambApplyWeightAssign、LambNextMV、LambNextMVWithDecay、LambNextRight、LambUpdateWithLr、LambUpdateWithLrV2、MultilabelMarginLoss、PoissonNllLoss 这 10 个算子在 op_host/*_infershape.cpp 中只注册了 InferShape,没有注册 InferDataType,GE 图通路上输出 dtype 缺少显式推导来源。这 10 个算子的 op_graph 原型、op_host def 与 op_kernel 均齐全,确属有 GE 图通路的算子。 ### 方法 在各算子已有的 op_host/*_infershape.cpp 中新增 InferDataType4<OpType>,并将原有 IMPL_OP_INFERSHAPE 注册扩展为 .InferShape(...).InferDataType(...)。各输出的 dtype 来源按算子语义逐个确定,未套用统一模板: | 算子 | 输出 dtype 来源 | |------|-----------------| | Relu6Grad | backprops ← gradients | | LambApplyOptimizerAssign | output0 ← grad;inputv / inputm 为同名 ref 输出,各自跟随同名输入 | | LambApplyWeightAssign | input_param 为同名 ref 输出,跟随第 5 个输入 | | LambNextMV | y1~y4 ← input_mul3 | | LambNextMVWithDecay | y1~y4 ← input_mul3 | | LambNextRight | y1、y2 ← input_square | | LambUpdateWithLr | y ← input_greater1 | | LambUpdateWithLrV2 | y ← x1 | | MultilabelMarginLoss | y ← x;**is_target ← target(INT32)** | | PoissonNllLoss | loss ← input_x | 其中 MultilabelMarginLoss 的 is_target 不能跟随 x,否则图上会把 INT32 的 is_target 推成浮点。各算子 def 中的 dtype 列表按位一一对应(lamb 系列为「全 fp16」或「全 fp32」两种组合,无混精),故以上取源自洽。 ### 关于摆放位置 仓内两种写法都有:以本 PR 基线计,op_host 的 IMPL_OP_INFERSHAPE(...).InferDataType(...) 共 323 个文件,op_graph 的 IMPL_OP(...).InferDataType(...) 共 90 个文件。本次按多数写法放在各算子已有的 op_host infershape 文件内,可直接扩展原注册行,每算子只改一个文件,diff 中仅删除 10 行旧注册行,未触碰存量代码格式。 ## 关联的Issue 关联 Issue #5417 ## 测试 bash build.sh -u --ophost --soc=ascend950 --ops=relu6_grad,lamb_apply_optimizer_assign,lamb_apply_weight_assign,lamb_next_m_v,lamb_next_m_v_with_decay,lamb_next_right,lamb_update_with_lr,lamb_update_with_lr_v2,multilabel_margin_loss,poisson_nll_loss 结果:**116 tests PASSED,0 FAILED**。其中包含本次为 10 个算子各新增的 1 条 infer_datatype 用例: [ OK ] relu6grad.relu6grad_infer_datatype [ OK ] MultilabelMarginLossInferShapeTest.multilabelmarginloss_infer_datatype [ OK ] PoissonNllLossInfershapeTest.poissonnllloss_infer_datatype [ OK ] LambApplyOptimizerAssignProtoTest.lambapplyoptimizerassign_infer_datatype [ OK ] LambApplyWeightAssignProtoTest.lambapplyweightassign_infer_datatype [ OK ] LambNextMVProtoTest.lambnextmv_infer_datatype [ OK ] LambNextMVWithDecayProtoTest.lambnextmvwithdecay_infer_datatype [ OK ] LambNextRightProtoTest.lambnextright_infer_datatype [ OK ] LambUpdateWithLrProtoTest.lambupdatewithlr_infer_datatype [ OK ] LambUpdateWithLrV2ProtoTest.lambupdatewithlrv2_infer_datatype 用例中的 ASSERT_NE(dataTypeFunc, nullptr) 实证该注册可被 OpImplRegistry 取到;MultilabelMarginLoss 那条显式断言 is_target 推导为 INT32;Relu6Grad 那条按 def 声明逐 dtype 覆盖 fp16 / fp32 / bf16。 门禁自检:clang-format 18.1.8 --style=file 20 个文件全通过;仓内 scripts/oat_check.sh 20 个文件 All checks passed;trailing-whitespace / end-of-file / 冲突标记检查通过。 **未覆盖**:本次仅验证到 op_host UT 层(用例通过 OpImplRegistry 取到 infer_datatype 函数指针后直接调用),未做真机与 GE 图 e2e 验证。 ## 文档更新 无。本次仅新增 InferDataType 注册与对应 UT,不涉及对外接口与算子资料变更。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9616 | 4 天前 | |
feat: modify readme product support Co-authored-by: Miao_Haifeng<miaohaifeng@huawei.com> # message auto-generated for no-merge-commit merge: !9457 merge mhf into master feat: modify readme product support Created-by: Almost_CANN Commit-by: Miao_Haifeng Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> LarsV2Update算子补充产品支持情况 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> NA ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> READEME.MD ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9457 | 8 天前 | |
docs(sgd): fix non-standard scalar shape description in README Co-authored-by: raoliang_sac<raoliang4@huawei.com> # message auto-generated for no-merge-commit merge: !8512 merge fix/issue-4680-sgd-readme into master docs(sgd): fix non-standard scalar shape description in README Created-by: raoliang_sac Commit-by: raoliang_sac Merged-by: cann-robot Description: ## 描述 修改 optim/sgd/README.md 中 learning_rate 和 momentum 参数的 shape 描述,将不符合文档标准的 "shape须为0维标量,或元素总数为1的tensor(如[1]、[1,1])" 改为标准的 "标量(元素个数为1)",与仓库其他算子的描述风格对齐。 ## 关联的Issue Fixes #4680 ## 测试 仅文档修改,无代码逻辑变更,无需测试。 ## 文档更新 更新了 optim/sgd/README.md 中 learning_rate 和 momentum 参数的 shape 约束描述。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!8512 | 25 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8571 merge doc into master docs: 更新16个算子README,新增支持Atlas A2/A3系列产品 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 更新16个算子README,新增支持Atlas A2/A3系列产品 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4785 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!8571 | 22 天前 | |
Format update: Adjusted the license description format in all relevant files. Co-authored-by: jiangqi<jiangqi47@h-partners.com> # message auto-generated for no-merge-commit merge: !365 merge license5 into master Format update: Adjusted the license description format in all relevant files. Created-by: jiangqi2025 Commit-by: jiangqi Merged-by: turing_project1 Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #123--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!365 | 8 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 5 天前 | ||
| 7 天前 | ||
| 5 天前 | ||
| 1 个月前 | ||
| 8 天前 | ||
| 1 个月前 | ||
| 10 天前 | ||
| 5 天前 | ||
| 9 天前 | ||
| 5 天前 | ||
| 15 天前 | ||
| 5 天前 | ||
| 8 天前 | ||
| 8 天前 | ||
| 1 个月前 | ||
| 7 天前 | ||
| 5 天前 | ||
| 7 天前 | ||
| 9 天前 | ||
| 8 天前 | ||
| 1 个月前 | ||
| 19 天前 | ||
| 8 天前 | ||
| 1 个月前 | ||
| 16 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 18 天前 | ||
| 1 个月前 | ||
| 9 天前 | ||
| 10 天前 | ||
| 22 天前 | ||
| 12 天前 | ||
| 9 天前 | ||
| 8 天前 | ||
| 8 天前 | ||
| 7 天前 | ||
| 5 天前 | ||
| 9 天前 | ||
| 18 天前 | ||
| 24 天前 | ||
| 30 天前 | ||
| 23 天前 | ||
| 7 天前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 8 天前 | ||
| 25 天前 | ||
| 22 天前 | ||
| 22 天前 | ||
| 22 天前 | ||
| 22 天前 | ||
| 22 天前 | ||
| 22 天前 | ||
| 8 个月前 |