| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 13 天前 | |
adam_apply_one_assign 算子geir测试用例修改 Co-authored-by: h1234515<huangzhiyuan21@huawei.com> # message auto-generated for no-merge-commit merge: !9253 merge adam_apply_one_assign_geir into master adam_apply_one_assign 算子geir测试用例修改 Created-by: h1234515 Commit-by: h1234515 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> adam_apply_one_assign 算子geir用例修改 跑bash build.sh --run_example adam_apply_one_assign graph --soc=ascend950时报错,将geir用例的static_cast<float*>改为(float*) ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5233 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> bash build.sh --run_example adam_apply_one_assign graph --soc=ascend950 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9253 | 15 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 13 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
refactor: 迁移 TF 插件注册至新框架 API(part 3) Co-authored-by: Nice_try<zhangzhiwei108@huawei.com> # message auto-generated for no-merge-commit merge: !9758 merge tf-plugin-part3 into master refactor: 迁移 TF 插件注册至新框架 API(part 3) Created-by: Nice_try Commit-by: Nice_try Merged-by: cann-robot Description: ## 描述 将 TF 框架侧自定义算子注册(REGISTER_CUSTOM_OP)从旧工具链迁移至 ops-nn 新仓(TF 插件迁移 part 3),共新增/调整 22 个 *_tf_plugin.cpp 注册文件。 ### 改动原因 1. 旧注册 API(ParseParamsFn/AutoMappingFn)与标量 OriginOpType({...}) 写法在新工具链已不适用,统一迁移为 ParseParamsByOperatorFn(AutoMappingByOpFn) 与 OriginOpType(std::vector<ge::AscendString>{...}) 形式; 2. 依赖 TF protobuf NodeDef(node_def.pb.h)的旧解析逻辑在新工具链中已不存在,相关解析改为基于 ge::Operator 的子图分解(ParseOpToGraphFn/FusionParseParamsFn)实现; 3. 承接本仓已完成的 TF 插件迁移 part 1/2,补齐剩余算子的 TF 注册。 ### 改动方法 按模块汇总: - common:新增 AscendWeightQuant(TF 字符串 dst_type 到 ge DataType 的转换解析)、GatherPoint(分解为 GatherV2+Const 子图)、GatherPointGrad(分解为 ScatterUpdate 子图)注册; - index:gather_v2 新增 Gather/ResourceGather 到自定义 Gather 的注册;scatter_add/scatter_sub 新增 TensorScatterAdd/TensorScatterSub 注册;新增 BroadcastGradientArgs、SparseSegmentMean、SparseSegmentMeanGrad、SparseSlice、SparseToDense 注册; - norm:BNInfer/BNTrainingReduceGrad/BNTrainingUpdateGrad/LayerNorm/LayerNormGrad 由 ParseParamsFn 迁移到 ParseParamsByOperatorFn;LayerNorm/LayerNormGrad 增补 FusedLayerNorm/FusedLayerNormGrad 双 origin 映射;bn_training_update_v2 新增 BNTrainingUpdate 注册; - optim:ApplyAdagrad 迁移新 API(保留 ApplyAdagrad/ResourceApplyAdagrad 双 origin); - matmul:新增 Einsum 注册; - rnn:新增 BlockLSTM(分解为 DynamicRNN 子图,含 seq_length 的 Cast 与输出重排)、DynamicRNN 融合解析(FusionParseParamsFn)与 DynamicRnn 注册、DynamicRNNV2/DynamicRnnV2 系列注册(含 is_misplaced 属性处理)。 ## 关联的Issue 关联 Issue #5505:https://gitcode.com/cann/ops-nn/issues/5505 ## 测试 本 PR 仅涉及注册/图解析代码迁移,无测试文件变更;依赖仓内 CI(编译、静态检查、UT/ST 工作流)验证。 ## 文档更新 无。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:TF 插件注册迁移(part 3) ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9758 | 10 天前 | |
perf: apply_adagrad_d arch35 kernel 以 Vec::Div 替换 Vec::DivHighPrecision 提升性能 Co-authored-by: huang-qiang<huangqiang3@huawei.com> # message auto-generated for no-merge-commit merge: !9875 merge agent/issue-74 into master perf: apply_adagrad_d arch35 kernel 以 Vec::Div 替换 Vec::DivHighPrecision 提升性能 Created-by: huang-qiang Commit-by: huang-qiang Merged-by: cann-robot Description: ## 描述 对 apply_adagrad_d 算子 arch35(Ascend950)后置 kernel 做除法指令选型优化,将 var 更新路径的高精度除法替换为标准除法,在精度影响可忽略的前提下获得整体提速。 ### 改动原因 apply_adagrad_d 的计算公式为: - accum += grad * grad - var -= lr * grad / sqrt(accum) arch35 DAG 实现(optim/apply_adagrad_d/op_kernel/arch35/apply_adagrad_d_dag.h)中,var 更新路径的 OpVarT = Bind<Vec::DivHighPrecision<T>, OpLrMulGrad, OpAccumSqrt> 使用高精度除法 Vec::DivHighPrecision,指令开销较高。经精度验证,该路径使用标准除法 Vec::Div 即可满足精度要求,故替换以提升性能。 ### 改动方法 在 apply_adagrad_d_dag.h 中完成两处替换,覆盖 update_slots 两种执行路径: | 结构 | 路径场景 | 修改内容 | |------|----------|----------| | ApplyAdagradDUpdateSlots | update_slots=true(accum 原地累加后开方) | Vec::DivHighPrecision<T> → Vec::Div<T> | | ApplyAdagradD | update_slots=false(直接使用传入 accum) | Vec::DivHighPrecision<T> → Vec::Div<T> | 影响范围:fp16 / bf16 / fp32 三种 dtype(tiling 层实例化于 apply_adagrad_d_tiling_arch35.cpp,fp16/bf16 内部提升为 float 计算)。另补充文件末尾换行符。 ## 关联的Issue - #5583 ## 测试 使用相同输入 + golden 配对验证(作者报告的验证结论): - **性能**:整体约 1.12x 提速,其中 bf16 约 1.31x。 - **精度**:accum 输出前后恒等;var 精度达标率 1203 → 1198(劣化 0.4%,最大误差不变),影响可忽略。 - 覆盖三种 dtype、小/中/大 shape、update_slots 两态、常规/次正规/±max/inf 边界取值。 ## 文档更新 无。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9875 | 8 天前 | |
MicroAPI namespace to Reg for arch35 kernels Co-authored-by: gcw_DS4cmz2b<1312925094@qq.com> # message auto-generated for no-merge-commit merge: !9267 merge rename into master MicroAPI namespace to Reg for arch35 kernels Created-by: gcw_DS4cmz2b Commit-by: gcw_DS4cmz2b Merged-by: cann-robot Description: ## 描述 修改了index,activation,matmul,conv,foreach,optim,experimental,vfusion,hash这几个文件夹内的命名空间,将MicroAPI-->Reg ## 关联的Issue [多个文件夹内的算子命名空间使用的MicroAPI,应改为Reg](https://gitcode.com/cann/ops-nn/issues/5218) ## 测试 验证方法 严格按四步流程,逐算子验证: 1. Step 1:编译原始代码,保存 baseline binary .o 文件 MD5 2. Step 2:执行 MicroAPI → Reg 替换 3. Step 3:编译替换后代码,保存 after binary .o 文件 MD5 4. Step 4:对比 A_before.md5 与 B_after.md5 平台:ascend950,编译参数:--soc=ascend950 --ops=<op> -j16 验证替换前后 binary 产物 MD5 完全一致。 冒烟,代码审查均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9267 | 17 天前 | |
fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Co-authored-by: wangrunfa<wangrunfa1@huawei.com> # message auto-generated for no-merge-commit merge: !9472 merge cherry-pick-mr-9347-1787965804708-auto into master fix: 整改 23 个 Ascend950 算子 arch35 日志规范 Created-by: wkx12138 Commit-by: wangrunfa Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 依据 cann-log-evaluation 12 条《CANN 日志规范》对 ops-nn 仓 Ascend950(arch35)算子扫描整改报告进行整改。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5343 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> 冒烟已跑 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:日志整改 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9472 | 13 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
AIDD拼写和标点问题修改 Co-authored-by: y60124828<yanglou1@h-partners.com> # message auto-generated for no-merge-commit merge: !10060 merge master into master AIDD拼写和标点问题修改 Created-by: yanglu-1 Commit-by: y60124828 Merged-by: cann-robot Description: ## 描述 AIDD拼写和标点问题修改 ## 关联的Issue 关联Issue #5680 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!10060 | 4 天前 | |
docs-fix Co-authored-by: jisongyuan<jisongyuan@h-partners.com> # message auto-generated for no-merge-commit merge: !10176 merge master into master docs-fix Created-by: ji-songyuan Commit-by: jisongyuan Merged-by: cann-robot Description: ## 描述 本 PR 对 apply_adam_w_quant、apply_fused_ema_adam 两个量化优化器算子接口文档进行约束修正,共涉及 2 个文件,改动量 +15/-15。 主要解决以下文档与实现不一致的问题: - **"非连续 Tensor"列约束标错**:文档参数表格中"非连续 Tensor"列对多个 Tensor 参数标记为 √(支持),但当前算子实现实际仅支持连续 Tensor 输入,标记与实现不符,会导致用户误以为可传入非连续 Tensor 而触发未定义行为 ### 改动明细 | # | 文件 | 改动 | 说明 | |---|------|------|------| | 1 | optim/apply_adam_w_quant/docs/aclnnApplyAdamWQuant.md | +9/-9 | 将 9 个参数(grad、mRef、vRef、qmapM、qmapV、absmaxMRef、absmaxVRef、step 及一个相邻行)的"非连续 Tensor"列由 √ 修正为 -,与算子实现保持一致 | | 2 | optim/apply_fused_ema_adam/docs/aclnnApplyFusedEmaAdam.md | +6/-6 | 将 6 个参数(varRef、mRef、vRef、sRef、step 及相邻行)的"非连续 Tensor"列由 √ 修正为 -,与算子实现保持一致 | ### 改动原则 - **纯文档修复,不改变任何代码逻辑**:所有改动均为 .md 文件内表格单元格的标记值修改,不涉及 .cpp/.h 源文件 - **对齐实现**:修正后的约束说明与当前算子实现中连续 Tensor 校验逻辑一致 - **聚焦最小改动**:仅修正约束标记值,不做额外的文档重构 ## 关联的Issue issue#5740 ## 测试 - 文档改动无需编译/功能测试,通过人工 review 验证描述与代码实现一致 - 改动不影响算子行为,CI 编译与功能测试结果不受影响 ## 文档更新 本 PR 即为文档更新,涉及以下文件: - optim/apply_adam_w_quant/docs/aclnnApplyAdamWQuant.md - optim/apply_fused_ema_adam/docs/aclnnApplyFusedEmaAdam.md ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!10176 | 3 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 16 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 15 天前 | |
feat(optim): add ApplyCamePart2 operator Co-authored-by: handsomeRobot_SK<suke13@huawei.com> # message auto-generated for no-merge-commit merge: !9121 merge apply_came_part2 into master feat(optim): add ApplyCamePart2 operator Created-by: handsomeRobot_SK Commit-by: handsomeRobot_SK Merged-by: cann-robot Description: ## PR: feat(optim): add ApplyCamePart2 operator ### 概述 新增 ApplyCamePart2 算子,实现 CAME 优化器 4-Part 拆分的第二部分(Part2)。在 Part1 已计算出 grad 的行/列/总和统计(sum_grad_r、sum_grad_c、sum_grad_rc)后,本算子对上一 step 的行/列二阶矩估计 r、c 做 EMA 更新,并用置信度归一化计算归一化更新方向 u,同时累加 u 的平方和 sum_square_u 供 Part3 继续消费。算子基于 Ascend C 开发,支持 Ascend950 (arch35) 平台,仅支持 GEIR 图模式调用。 CAME 优化器分四个 Part 串行执行:本算子为第二部分,完成 r/c 二阶矩 EMA 更新与归一化更新方向 u 的计算;与 ApplyCamePart1(梯度统计)、ApplyCamePart3(裁剪 + 一阶矩)、ApplyCamePart4(参数更新)配套使用。其中 r、c 为原地(in-place)更新。 ### 算子功能 实现 CAME 优化器 Part2 阶段的计算公式(对齐 kernel 实现): $$ \begin{aligned} r_{\text{out}} &= \beta_2 \cdot r + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_r}}{M} \\ c_{\text{out}} &= \beta_2 \cdot c + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_c}}{N} \\ \text{denom} &= \beta_2 \cdot \frac{\text{sum\_r}}{N} + (1 - \beta_2) \cdot \frac{\text{sum\_grad\_rc}}{M \cdot N} \\ u &= \frac{\text{grad}}{\sqrt{r_{\text{out}} \cdot c_{\text{out}} \,/\, \text{denom}}} \\ \text{sum\_square\_u} &= \sum (u \odot u) \end{aligned} $$ 其中 $N=\text{grad.shape}[0]$ 为行数、$M=\text{grad.shape}[1]$ 为列数,$r_{\text{out}}$ 按行广播、$c_{\text{out}}$ 按列广播,$\text{sum\_r}$ 缺省时由算子内部计算 $\sum r$,$\text{global\_shape}$ 缺省时取 grad 的 $[N, M]$。 **关键特性**: - **In-place 更新**:r/c 输出与输入同名共享 GM 地址,框架将同一 GM 地址传给 kernel 的输入/输出参数,kernel 先读输入再写输出,并在 SyncAll 后读取更新值,原地语义正确 - **三阶段串行流水线**:Kernel 分 ProcessR(行二阶矩 EMA)→ ProcessC(列二阶矩 EMA)→ ProcessU(归一化方向 + 平方和)三阶段串行执行,阶段间通过 SyncAll 全核同步保证数据一致性 - **Pre/Post 辅助核**:Pre 阶段(sum_r 缺省时触发)分块计算 $\sum r$ 并通过 AtomicAdd 写入 workspace;Post 阶段由 core0 跨核归约 sum_square_u - **TypicalNet 优化**:对常见网络 shape(1024×1024、1024×4096、4096×1024、116736×1024)使用专用 TilingKey(201-203)和精简 kernel 路径 - **多 dtype 支持**:grad/r/c 支持 FP16/FP32/BF16;u/sum_square_u 强制 FP32 保精度;FP16/BF16 路径使用 ApplyCamePart2Float16 专用类 ### 对标竞品 | 竞品 | 接口 | 说明 | |------|------|------| | PyTorch | came_pytorch CAME optimizer | 功能对标,PyTorch 在 Python 层实现单阶段融合 | | NumPy | CPU 参考实现 | 功能对标,CANN 拆分为 4-Part 串行 | ### 支持规格 | 项目 | 支持情况 | |------|---------| | **数据类型** | float16, float32, bfloat16(grad/r/c);float32(u/sum_square_u/sum_grad_r/c/rc/beta2/sum_r);int64(global_shape) | | **数据格式** | ND | | **平台** | Ascend950 (arch35)、Atlas A3 训练/推理系列、Atlas A2 训练/推理系列 | | **调用模式** | GEIR 图模式 | | **输入端口** | 9 个(7 REQUIRED: grad, sum_grad_r, sum_grad_c, sum_grad_rc, r, c, beta2;2 OPTIONAL: sum_r, global_shape) | | **输出端口** | 4 个(r, c, u, sum_square_u;r/c 原地更新) | | **维度** | 仅支持 2D grad(rank=2,shape=[N, M]) | ### 交付件清单 optim/apply_came_part2/ ├── CMakeLists.txt # 构建配置 ├── README.md # 算子说明文档 ├── examples/ │ ├── test_geir_apply_came_part2.cpp # GEIR 图模式调用示例 │ └── arch35/ │ ├── test_geir_apply_came_part2.cpp # GEIR 静态数值校验 │ └── test_geir_apply_came_part2_dynamic.cpp # GEIR 动态 shape 校验 ├── op_graph/ │ ├── apply_came_part2_proto.h # GE IR 原型定义(9输入4输出,r/c同名原地) │ └── apply_came_part2_graph_infer.cpp # 图模式 InferDataType ├── op_host/ │ ├── apply_came_part2_def.cpp # 算子定义(7+2输入4输出) │ ├── apply_came_part2_infershape.cpp # 形状推导(u=grad.shape, r/c=输入shape) │ └── arch35/ │ ├── apply_came_part2_tiling_arch35.h # Tiling 数据结构 + CompileInfo │ └── apply_came_part2_tiling_arch35.cpp # Tiling 计算(596行) ├── op_kernel/ │ ├── apply_came_part2.cpp # Kernel 入口(6 TilingKey 分发 + Pre/Post) │ └── arch35/ │ ├── apply_came_part2.h # 通用 Kernel 类声明(976行实现) │ ├── apply_came_part2_common.h # 公共常量与工具函数 │ ├── apply_came_part2_pre.h # Pre 阶段:sum_r 计算 │ ├── apply_came_part2_post.h # Post 阶段:sum_square_u 跨核归约 │ ├── apply_came_part2_float16.h # FP16/BF16 专用 Kernel │ ├── apply_came_part2_typical_net.h # TypicalNet 专用 Kernel(float) │ └── apply_came_part2_float16_typical_net.h # TypicalNet 专用 Kernel(fp16/bf16) └── tests/ut/op_host/ ├── test_apply_came_part2_infershape.cpp # InferShape UT └── arch35/ └── test_apply_came_part2_tiling.cpp # Tiling UT ### 测试验证 #### 单元测试 (UT) - **覆盖范围**:InferShape + Tiling - **状态**:已交付 - **InferShape UT**:grad rank 校验、shape copy 正确性 - **Tiling UT**:形状校验、多核切分、TypicalNet 检测、Workspace 分配 #### GEIR 端对端验证 - **状态**:已交付 - **静态数值校验**:构图运行并与 CPU golden 逐值比对 r/c/u/sum_square_u - **动态 shape 校验**:动态维度(-1)与动态 rank(-2)多组 shape 校验 - **覆盖范围**: - 数据类型:FP32 / FP16 / BF16 - 形状组合:常规 shape + TypicalNet shape - 特殊场景:空 Tensor(N=0 或 M=0)、可选输入 sum_r/global_shape 缺省 ### 代码质量 - ✅ 文件头格式统一(Copyright 注释块) - ✅ Tiling 校验使用 OP_LOGE/VECTOR_INNER_ERR_REPORT 统一日志格式(rank/shape/dtype 三级校验) - ✅ 魔鬼数字常量化(BLOCK_SIZE=32, CALC_SIZE=256, CACHE_LINE=512, NUM_SCALAR_IN_UB=7) - ✅ InferShape 使用 OP_CHECK_NULL_WITH_CONTEXT + OP_CHECK_IF 格式 - ✅ InferDataType 支持图模式注册 - ✅ Kernel 三阶段流水线 + SyncAll 全核同步保证数据一致性 - ✅ In-place r/c 更新语义正确(先读后写 + SyncAll 后再读) - ✅ TypicalNet 优化路径覆盖 4 组常见 shape - ✅ 单元测试已交付(InferShape UT + Tiling UT) - ✅ GEIR 端对端示例已交付(静态 + 动态 shape) ### 编译验证 bash cd ops-nn bash build.sh --soc=ascend950 --pkg --ops=apply_came_part2 -j 256 # 预期输出 ✅ 编译成功 ✅ 生成算子包:cann-ops-nn-custom_linux-x86_64.run ### 关键实现细节 #### 1. 算子接口 | 参数 | 类型 | 说明 | |:-----|:-----|:-----| | INPUT grad | Tensor (REQUIRED) | 梯度,二维张量 [N, M],fp16/fp32/bf16 | | INPUT sum_grad_r | Tensor (REQUIRED) | grad 按行求和,shape [N],fp32 | | INPUT sum_grad_c | Tensor (REQUIRED) | grad 按列求和,shape [M],fp32 | | INPUT sum_grad_rc | Tensor (REQUIRED) | grad 全体元素之和,shape [1],fp32 | | INPUT r | Tensor (REQUIRED) | 行二阶矩估计,shape [N],fp16/fp32/bf16 | | INPUT c | Tensor (REQUIRED) | 列二阶矩估计,shape [M],fp16/fp32/bf16 | | INPUT beta2 | Tensor (REQUIRED) | 二阶矩衰减系数,标量 shape [1],fp32 | | OPTIONAL_INPUT sum_r | Tensor (OPTIONAL) | r 的全体元素之和,shape [1],fp32 | | OPTIONAL_INPUT global_shape | Tensor (OPTIONAL) | 原始 [N, M],shape [2],int64 | | OUTPUT r | Tensor (REQUIRED) | 更新后的行二阶矩,shape [N],原地更新 | | OUTPUT c | Tensor (REQUIRED) | 更新后的列二阶矩,shape [M],原地更新 | | OUTPUT u | Tensor (REQUIRED) | 归一化更新方向,shape = grad.shape,强制 fp32 | | OUTPUT sum_square_u | Tensor (REQUIRED) | u 的平方和,shape [1],fp32 | #### 2. Kernel 实现 - **架构**:三阶段串行流水线(ProcessR → ProcessC → ProcessU)+ Pre/Post 辅助核 - **TilingKey 分发**:6 个 Key(101-103 通用路径,201-203 TypicalNet 路径),通过 TILING_KEY_IS 宏分发 - **ProcessR**:行二阶矩 EMA 更新,r_out = beta2*r + (1-beta2)*sum_grad_r/M(Muls + Axpy) - **ProcessC**:列二阶矩 EMA 更新,c_out = beta2*c + (1-beta2)*sum_grad_c/N(Muls + Axpy) - **ProcessU**: 1. 计算 denom = beta2*sum_r/N + (1-beta2)*sum_grad_rc/(M*N) 2. CopyInUr/CopyInUc:加载更新后的 r/c 3. CopyInGrad:分块加载 grad 4. BroadcastR → TransposeR(ConfusionTranspose) → MulRC(r*c) → Muls(rcCoefficient) → Sqrt → Div(grad/sqrt) → Mul(u*u) → ReduceSumU 5. CopyOutU:写 u 到 GM + 写 per-core sum_square_u 到 workspace #### 3. 精度策略 - **FP32**:原生计算,无转换 - **FP16/BF16**:r/c 更新使用原生 dtype(Muls/Axpy 支持);u 计算在 ApplyCamePart2Float16 类中使用 Cast→FP32 计算→u 强制 fp32 输出 #### 4. Tiling 实现 - **形状校验**:grad rank==2;r/c/sum_grad_r/sum_grad_c/sum_grad_rc rank==1;shape 一致性;dtype 一致性 - **Tiling4CalcR**:按 N 切分多核,UB 空间按 N/(N+M) 比例分配,对齐 32B - **Tiling4CalcC**:按 M 切分多核,UB 空间按 M/(N+M) 比例分配,对齐 32B - **Tiling4CalcRc**:复用 r 切分,行方向按 CALC_SIZE/4 切分,列方向按 CALC_SIZE 切分 - **TypicalNet**:4 组 shape(1024×1024 等)使用 128 对齐 + 全列加载优化 - **Workspace**:sysWorkspace(16MB) + sumRWorkspace(512B) + sumSquareUWorkspace(核数×loop 数,512B 对齐) #### 5. In-place 优化 - r/c 输出与输入同名,框架保证 GM 地址一致 - Kernel ProcessR/ProcessC 先读输入 r/c 再写输出 r_out/c_out - SyncAll 后 ProcessU 从 rOutGm_/cOutGm_ 读取更新后的值 - Proto 定义中 INPUT r/c 与 OUTPUT r/c 同名,实现原地语义 ### 依赖与限制 - **依赖**:CANN 9.0.0 - **配套算子**:ApplyCamePart1(梯度统计)、ApplyCamePart3(裁剪 + 一阶矩)、ApplyCamePart4(参数更新) - **限制**: - 仅支持 GEIR 图模式(无 ACLNN 接口) - 仅支持 Ascend950 (arch35) - 仅支持 2D grad(rank=2,shape=[N, M]) - grad/r/c 三者 dtype 必须一致 - r/c 为原地输出 - 支持空 Tensor(N=0 或 M=0 时返回空结果,不报错) - 支持可选输入 sum_r(缺省时内部计算)和 global_shape(缺省时取 grad shape) ### Checklist - [x] 代码符合 ops-nn 内置算子标准 - [x] 文件头格式统一 - [x] Tiling 校验规范化(rank/shape/dtype 三级) - [x] clang-format 格式化 - [x] InferShape 支持 rank 校验 - [x] InferDataType 支持图模式注册 - [x] Kernel 三阶段流水线 + SyncAll 同步 - [x] In-place r/c 更新语义正确 - [x] TypicalNet 优化路径 - [x] 单元测试通过(InferShape UT + Tiling UT) - [x] GEIR 端对端验证通过(静态 + 动态 shape) - [x] README 文档完整 - [ ] 编译安装验证通过(待验证) See merge request: cann/ops-nn!9121 | 13 天前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 15 天前 | |
feat: 新增 ApplyCamePart4 算子 Co-authored-by: tianqiguang<tianqiguang@huawei.com> # message auto-generated for no-merge-commit merge: !9123 merge master into master feat: 新增 ApplyCamePart4 算子 Created-by: tianqiguang Commit-by: tianqiguang Merged-by: cann-robot Description: ## 描述 新增 ApplyCamePart4 算子,用于 CAME 优化器第 4 段(参数更新段)。 输入待更新参数 param_in、一阶动量 m(形状 (N,M))与置信因子 r_in(N)、c_in(M),按 CAME 更新规则回写 param_out、r_out、c_out。sum_r(全 N 行 r_in 的归约和)与 global_shape(全局 N,M)为可选输入:分布式场景由前序算子/全局形状传入;单机场景缺省,kernel 内部完成归约并取本地 n/m。 - 数据类型:param_in/m/r_in/c_in 及输出 param_out/r_out/c_out 支持 FLOAT/FLOAT16/BFLOAT16;weight_decay/lr/beta3/sum_r/sum_u_r/sum_u_c/sum_u_rc 恒为 FLOAT;global_shape 为 INT64。 - 数据格式:全部 ND。 - 无属性(attr);weight_decay/lr/beta3 等标量均作为输入传入。 - 平台:Ascend 950PR/Ascend 950DT(arch35,本仓 vendor 包);Atlas A2 系列由 canndev 内置 ascendc 实现支持。 ## 关联的Issue - #5176 ## 测试 - 新增 tiling 单测:tests/ut/op_host/arch35/test_apply_came_part4_tiling.cpp - 新增 infershape 单测:tests/ut/op_host/test_apply_came_part4_infershape.cpp - 新增 golden 数据:tests/assets/golden.py - 新增图模式调用样例:examples/test_geir_apply_came_part4.cpp ## 文档更新 - 新增算子 README:optim/apply_came_part4/README.md - 更新算子清单:docs/zh/op_list.md ## 类型标签 - [x] 新特性 ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!9123 | 17 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
docs-fix Co-authored-by: jisongyuan<jisongyuan@h-partners.com> # message auto-generated for no-merge-commit merge: !10176 merge master into master docs-fix Created-by: ji-songyuan Commit-by: jisongyuan Merged-by: cann-robot Description: ## 描述 本 PR 对 apply_adam_w_quant、apply_fused_ema_adam 两个量化优化器算子接口文档进行约束修正,共涉及 2 个文件,改动量 +15/-15。 主要解决以下文档与实现不一致的问题: - **"非连续 Tensor"列约束标错**:文档参数表格中"非连续 Tensor"列对多个 Tensor 参数标记为 √(支持),但当前算子实现实际仅支持连续 Tensor 输入,标记与实现不符,会导致用户误以为可传入非连续 Tensor 而触发未定义行为 ### 改动明细 | # | 文件 | 改动 | 说明 | |---|------|------|------| | 1 | optim/apply_adam_w_quant/docs/aclnnApplyAdamWQuant.md | +9/-9 | 将 9 个参数(grad、mRef、vRef、qmapM、qmapV、absmaxMRef、absmaxVRef、step 及一个相邻行)的"非连续 Tensor"列由 √ 修正为 -,与算子实现保持一致 | | 2 | optim/apply_fused_ema_adam/docs/aclnnApplyFusedEmaAdam.md | +6/-6 | 将 6 个参数(varRef、mRef、vRef、sRef、step 及相邻行)的"非连续 Tensor"列由 √ 修正为 -,与算子实现保持一致 | ### 改动原则 - **纯文档修复,不改变任何代码逻辑**:所有改动均为 .md 文件内表格单元格的标记值修改,不涉及 .cpp/.h 源文件 - **对齐实现**:修正后的约束说明与当前算子实现中连续 Tensor 校验逻辑一致 - **聚焦最小改动**:仅修正约束标记值,不做额外的文档重构 ## 关联的Issue issue#5740 ## 测试 - 文档改动无需编译/功能测试,通过人工 review 验证描述与代码实现一致 - 改动不影响算子行为,CI 编译与功能测试结果不受影响 ## 文档更新 本 PR 即为文档更新,涉及以下文件: - optim/apply_adam_w_quant/docs/aclnnApplyAdamWQuant.md - optim/apply_fused_ema_adam/docs/aclnnApplyFusedEmaAdam.md ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!10176 | 3 天前 | |
TF plugin 迁移2 Co-authored-by: sunchun<sunchun4@h-partners.com> # message auto-generated for no-merge-commit merge: !7586 merge nn2 into master TF plugin 迁移2 Created-by: sunchun Commit-by: sunchun Merged-by: cann-robot Description: ## 描述 TF plugin 迁移 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4196 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7586 | 1 个月前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
FusedAdam算子950实现 Co-authored-by: Tower19<liudingming3@huawei.com> # message auto-generated for no-merge-commit merge: !8934 merge master into master FusedAdam算子950实现 Created-by: Tower19 Commit-by: Tower19 Merged-by: cann-robot Description: ## 描述 完成FusedAdam算子kernel实现 ## 关联的Issue 待补充 ## 测试 待补充 ## 文档更新 更新了相关readme文档 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!8934 | 10 天前 | |
docs-fix Co-authored-by: jisongyuan@h-partners.com<jisongyuan@h-partners.com> # message auto-generated for no-merge-commit merge: !10031 merge master into master docs-fix Created-by: ji-songyuan Commit-by: jisongyuan@h-partners.com Merged-by: cann-robot Description: ## 描述 本 PR 对 fused_adamw 算子接口文档进行约束补充修复,涉及 1 个文件,改动量 +5/-5。 主要解决以下文档缺失约束说明的问题: - **空 Tensor 约束未声明**:5 个 TensorList 输入参数的描述中未明确"不支持空 Tensor"约束,读者无法从文档获知该限制,可能导致传入空 Tensor 触发未定义行为 ### 改动明细 | # | 文件 | 改动 | 说明 | |---|------|------|------| | 1 | optim/fused_adamw/docs/aclnnFusedAdamw.md | +5/-5 | 为 5 个 TensorList 参数(paramsRef、grads、expAvgsRef、expAvgSqsRef、maxExpAvgSqsRef)的描述补充"不支持空 Tensor"约束说明,使用 <ul><li> 列表形式包裹,与文档其他参数的约束说明风格保持一致 | ### 改动原则 - **纯文档修复,不改变任何代码逻辑**:所有改动均为 .md 文件内的文字描述,不涉及 .cpp/.h 源文件 - **对齐实现**:修正后的描述与当前算子实现中空 Tensor 校验逻辑一致 - **聚焦最小改动**:仅补充缺失约束说明,不做额外的文档重构 ## 关联的Issue issue #4847 ## 测试 - 文档改动无需编译/功能测试,通过人工 review 验证描述与代码实现一致 - 改动不影响算子行为,CI 编译与功能测试结果不受影响 ## 文档更新 本 PR 即为文档更新,涉及以下文件: - optim/fused_adamw/docs/aclnnFusedAdamw.md ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!10031 | 5 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
docs_fix Co-authored-by: jisongyuan@h-partners.com<jisongyuan@h-partners.com> # message auto-generated for no-merge-commit merge: !9894 merge master into master docs_fix Created-by: ji-songyuan Commit-by: jisongyuan@h-partners.com Merged-by: cann-robot Description: ## 描述 本 PR 对 ctc_loss、l1_loss、fused_adamw、fused_sgd 四个算子的接口文档(.md)进行勘误修复,共涉及 4 个文件,改动量 +15/-16。 主要解决以下文档与实现不一致的问题: - **参数名大小写不一致**:文档中参数名与实际接口签名不符 - **描述对象错误**:文档描述的作用对象与实际接口语义不匹配 - **约束条件过时**:文档约束与当前实现逻辑不符 - **参数命名规范**:文档参数名未遵循 camelCase 规范 ### 改动明细 | # | 文件 | 改动 | 说明 | |---|------|------|------| | 1 | loss/ctc_loss_v2/docs/aclnnCtcLossV2.md | 多处 | 将 targetLengths 统一改为 targetlengths,与实际 aclIntArray* 参数命名一致,消除大小写歧义 | | 2 | loss/lp_loss/docs/aclnnL1Loss.md | +2/-2 | 修正 target 参数描述:broadcast 关系对象由 gradOutput、target 更正为 self;补充 out 参数说明为"输出 tensor,存放 L1Loss 计算结果",并将"shape 只支持 0 维"规范为"out 为 0 维 tensor" | | 3 | optim/fused_adamw/docs/aclnnFusedAdamw.md | +1/-1 | 修正约束描述:原"数据格式不在支持范围"更正为"数据类型不同",与实际类型校验逻辑一致 | | 4 | optim/fused_sgd/docs/aclnnFusedSgd.md | +1/-2 | 参数名 workspace_size 更正为 workspaceSize,与 aclnnFusedSgd 接口签名一致;删除过时的 gradScale 等于 0 约束说明 | ### 改动原则 - **纯文档修复,不改变任何代码逻辑**:所有改动均为 .md 文件内的文字描述,不涉及 .cpp/.h 源文件 - **对齐实现**:修正后的描述与当前算子实现、接口签名、约束逻辑保持一致 - **聚焦最小改动**:仅修正文档与实现不一致项,不做额外的文档重构 ## 关联的Issue Issue #5554 ## 测试 - 文档改动无需编译/功能测试,通过人工 review 验证描述与代码实现一致 - 改动不影响算子行为,CI 编译与功能测试结果不受影响 ## 文档更新 本 PR 即为文档更新,涉及以下文件: - loss/ctc_loss_v2/docs/aclnnCtcLossV2.md - loss/lp_loss/docs/aclnnL1Loss.md - optim/fused_adamw/docs/aclnnFusedAdamw.md - optim/fused_sgd/docs/aclnnFusedSgd.md ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [ ] AI辅助编写 See merge request: cann/ops-nn!9894 | 9 天前 | |
feat(optim): add InplaceApplyAdaMax operator for Ascend950 Co-authored-by: Miao_Haifeng<miaohaifeng@huawei.com> # message auto-generated for no-merge-commit merge: !8919 merge inplace_apply_ada_max_code_review into master feat(optim): add InplaceApplyAdaMax operator for Ascend950 Created-by: Almost_CANN Commit-by: Miao_Haifeng Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 功能说明 - **算子功能**:执行AdaMax优化器的单步参数更新。AdaMax是Adam优化器的变体,使用无穷范数 $L_{\infty}$ 代替二阶矩估计,对权重 var、一阶矩m、无穷范数v进行更新。输出端口名 var/m/v 与输入同名(GE inplace 别名),框架将输出内存别名到输入内存,实现原地更新。 - **计算公式**: 给定时间步 $t$ 的梯度 $g_t$,衰减系数 $\beta_1, \beta_2$,学习率 $lr$,数值稳定常数 $\epsilon$,以及外部传入的偏差校正因子 $\beta_1^t$: $$ \begin{aligned} m_{t} &= \beta_1 \cdot m_{t-1} + (1 - \beta_1) \cdot g_t \\ v_{t} &= \max(\beta_2 \cdot v_{t-1},\ |g_t|) \\ var_{t} &= var_{t-1} - \frac{lr}{1 - \beta_1^t} \cdot \frac{m_t}{v_t + \epsilon} \end{aligned} $$ 算子原型:9输入 + 3输出 (var/m/v,输出名与输入同名 = GE inplace 别名) + 1属性 (use_locking)。对齐 canndev REG_OP(ApplyAdaMaxD)。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 更新了ops-nn/docs/zh/op_list.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8919 | 20 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
[CANNBOT]:新增 InplaceApplyAdamWithAmsgrad 算子适配Ascend950 Co-authored-by: Coder_Nerd<shishuai5@huawei.com> # message auto-generated for no-merge-commit merge: !9467 merge readme into master [CANNBOT]:新增 InplaceApplyAdamWithAmsgrad 算子适配Ascend950 Created-by: Coder_Nerd Commit-by: Coder_Nerd Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增 InplaceApplyAdamWithAmsgrad 算子(GEIR 通路,BF16/FP16/FP32) InplaceApplyAdamWithAmsgrad对AMSGrad优化器的四个状态张量var、m、v、vhat执行单步原地更新,语义对标TensorFlow ResourceApplyAdamWithAmsgrad。var、m、v、vhat在原地写回更新值;grad与六个标量超参参与计算,全部张量输入输出共享同一数据类型。 计算公式如下,更新依赖顺序固定为m→v→vhat(使用新v)→var(使用新m): $$ \alpha = lr \times \frac{\sqrt{1 - beta2\_power}}{1 - beta1\_power} $$ $$ m = m + (grad - m) \times (1 - beta1) $$ $$ v = v + (grad \times grad - v) \times (1 - beta2) $$ $$ vhat = where(vhat < v,\ v,\ vhat) $$ $$ var = var - \frac{m \times \alpha}{\sqrt{vhat} + epsilon} $$ ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5407 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9467 | 10 天前 | |
[CANNBot]新增inplace_apply_add_sign优化器算子支持Ascend950 Co-authored-by: chen_chenn<chenchen167@huawei.com> # message auto-generated for no-merge-commit merge: !9013 merge inplace_apply_add_sign into master [CANNBot]新增inplace_apply_add_sign优化器算子支持Ascend950 Created-by: chen_chenn Commit-by: chen_chenn Merged-by: cann-robot Description: ## 描述 新增inplace_apply_add_sign优化器算子支持Ascend950 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5507 ## 测试 TTK obp冒烟 二级冒烟 ## 文档更新 optim/inplace_apply_add_sign/README.md ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9013 | 10 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
修复host侧数据格式校验等内容 Co-authored-by: zhaixiao<zhaixiao1@huawei.com> # message auto-generated for no-merge-commit merge: !9956 merge fix/inplace-apply-ftrl-precision into master 修复host侧数据格式校验等内容 Created-by: Onthetreeoh Commit-by: zhaixiao Merged-by: cann-robot Description: ## 描述 host侧新增数据格式校验,包括学习率等参数的rank-0,format校验,以及补充文档内容中参数的值域要求。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9956 | 6 天前 | |
fix: 提升InplaceApplyFtrlV2精度并补充输入校验 Co-authored-by: Bright0313<liwenbo84@huawei.com> # message auto-generated for no-merge-commit merge: !9940 merge codex/inplace-apply-ftrl-v2-precision-review-fixes into master fix: 提升InplaceApplyFtrlV2精度并补充输入校验 Created-by: Bright0313 Commit-by: Bright0313 Merged-by: cann-robot Description: ## 修复内容 InplaceApplyFtrlV2 精度与约束修复(同一次三方精度测试和资料扫描发现): ### 1. kernel(op_kernel/arch35/inplace_apply_ftrl_v2_kernel.h) - FLOAT 的 accumulation_new 改用融合乘加,减少一次中间舍入。 - 针对 -0.05、-0.9、-1.5、-3 等指数增加分段幂差算法,降低相近幂值直接相减的消减误差。 - FLOAT 默认采用 (delta_power * var) / lr 的先乘后除顺序;-0.75 与低精度路径保留原顺序。 - 接口、dtype、输出定义和 Tiling 方案不变。 ### 2. host 校验(op_host/arch35/inplace_apply_ftrl_v2_tiling_arch35.cpp) - 显式拒绝 use_locking=true。 - 显式校验 9 路输入和 3 路输出均为 FORMAT_ND。 - 显式校验 3 路输出 dtype 与 var 一致。 ### 3. UT 与资料 - 新增 use_locking、非 ND format、输出 dtype 不一致的 Host UT。 - README 补充自动连续化说明。 ## 验证结果 - Ascend 950 Kernel 构建通过;Host UT 12/12 PASS。 - pre-commit 全项 PASS;pre-push 快速门禁中的 ophost UT、opkernel UT、Ascend950 pkg 均 PASS。 - 三方固定 200 条、seed=123:修改前 190/200,修改后 196/200;其余用例按 N=1000、Bootstrap 2000 次复检后满足复检通过标准。 - 两方 stat_rel_err、FP32 中间计算 Golden:183/204 PASS(BF16 57/60、FP16 56/61、FP32 70/83),accumulation_new 204/204 PASS;失败仅涉及 var_new 或 linear_new,与三方 cross_check 分开记录。 - 新增覆盖用例 4/4 PASS:rank 0、≥1 GiB FP16 压力、FLOAT -0.0、BF16 -0.0。 See merge request: cann/ops-nn!9940 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
fix: InplaceApplyMentarum FP32 path var_out accuracy exception Co-authored-by: niukang_hw<niukang1@huawei.com> # message auto-generated for no-merge-commit merge: !8566 merge dev_inplace_apply_momentum into master fix: InplaceApplyMentarum FP32 path var_out accuracy exception Created-by: niukang_hw Commit-by: niukang_hw Merged-by: cann-robot Description: ## 描述 ### 1. 问题描述 InplaceApplyMomentum 算子 FP32 dtype 下 var_out 输出精度异常。TTK 100 条白盒用例中 42 条失败(PassRate 58%),失败模式为 var_out=FAIL, accum_out=PASS。FP16/BF16 路径不受影响。多核场景(65536元素/43核)下两个输出均错误。 根因有两个: - FP32 路径将 Vector 计算结果直接从 VECIN TQue buffer 执行 DataCopyPad(MTE3),缺少 V→MTE3 同步,写出未更新的脏数据 - 标量 lr/momentum 通过黑名单 API GlobalTensor::GetValue() 直接从 GM 读取,多核并发读取导致标量值错误 ### 2. 环境信息 - NPU: Ascend950PR (DAV_3510, arch35) - CANN: 9.0.0 - 算子仓: ops-nn, optim/inplace_apply_momentum - TTK: ops-test-kit 3.0.0 ### 3. 重现步骤 bash # 1. 编译安装算子 cd <ops-nn repo> source /usr/local/Ascend/cann-9.0.0/set_env.sh bash build.sh --ops=inplace_apply_momentum --soc=ascend950 cd build_out && bash cann-ops-nn-custom_linux-x86_64.run --install-path=/usr/local/Ascend/cann-9.0.0/opp --quiet --install-for-all # 2. 运行 TTK 测试(float32, shape=(65536,), 43核) cd <ops-test-kit> python3 -m ttk kernel -i <test_csv> \ --plugin <golden_dir> \ -t iam_012 --single-log # 3. 观察结果 # DYN_GOLD: FAIL,PASS (var_out=FAIL, accum_out=PASS) # precision_metrics: mere=0.0008, mare=7.83, threshold=0.0001220703125 最小复现:var=[1.0], accum=[0.5], lr=[0.01], grad=[0.1], momentum=[0.9], dtype=float32,golden 期望 var_out=0.9945,实际 kernel 输出 var_out=0(脏数据)。 ### 4. 预期结果 100 条白盒用例全部 PASS(PassRate 100%),var_out 与 golden tf.raw_ops.ResourceApplyMomentum 在容差范围内一致(FP32 rtol=1e-4)。 ### 5. 日志 / 截图 === 修复前 === TTK Test Summary: Total=100, PASS=58, FAIL=42, PassRate=58% iam_012 (float32, shape=(65536,), 43核): out[0] (var_out): mere=0.0008, mare=7.83, th=0.000122, FAIL out[1] (accum_out): mere=0.006, mare=37.0, th=0.000122, FAIL === 修复后 === TTK Test Summary: Total=100, PASS=100, FAIL=0, PassRate=100% 修复涉及两个文件: - op_kernel/arch35/inplace_apply_momentum.h:FP32 路径新增 VECOUT TQue 输出;标量读取从 GetValue() 改为 DataCopyPad+LocalTensor.GetValue() - op_host/arch35/inplace_apply_momentum_tiling_arch35.cpp:FP32_UB_BYTES_PER_ELEM 从 16 调整为 24 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4737 ## 测试 修复后,TTK Test Summary: Total=100, PASS=100, FAIL=0, PassRate=100% ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8566 | 1 个月前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
feat(inplace_apply_proximal_gradient_descent): 新增Ascend950 GE图实现 Co-authored-by: babeiee<125106023003@njust.edu.cn> # message auto-generated for no-merge-commit merge: !9468 merge feat/inplace-apply-proximal-gradient-descent into master feat(inplace_apply_proximal_gradient_descent): 新增Ascend950 GE图实现 Created-by: babeiee Commit-by: babeiee Merged-by: cann-robot Description: ## 描述 新增 inplace_apply_proximal_gradient_descent 算子的 Ascend950 GE 图模式实现: - 新增 OpDef、GEIR 原型、shape/dtype 推导与图注册。 - 新增 Ascend950 Tiling、六个 dtype/buffer 分支及 RegBase Vector Kernel。 - 支持 BF16、FP16、FP32,rank 0-16,0-D/[1] 标量载体与空 Tensor。 - 补充各分支 Host Tiling UT、GEIR 示例、README 和算子列表。 ## 关联的Issue []https://gitcode.com/cann/ops-nn/issues/5327 ## 测试 - pre-commit run --from-ref origin/master --to-ref HEAD:全部通过,包括 clang-format、codespell、OAT。 - FAST pre-push:JIT build、ophost UT、opgraph UT、opkernel UT、Ascend950 package 全部通过。 - GEIR 两方精度:200/200 PASS。 - TensorFlow GPU 三方 L1 cross-check:200/200 PASS;CST/DYN 嵌套输出 400/400 PASS。 ## 文档更新 - 新增算子 README.md。 - 更新 docs/zh/op_list.md。 ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9468 | 10 天前 | |
BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Co-authored-by: tianyu52<tianyu52@huawei.com> # message auto-generated for no-merge-commit merge: !9453 merge master into master BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 Created-by: tianyu52 Commit-by: tianyu52 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> BNInfer,InplaceApplyRMSProp以及ApplyCamePart1算子检视意见闭环 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> BNInfer:泛化测试1000条均PASS InplaceApplyRMSProp:泛化测试1000条均PASS ApplyCamePart1:泛化测试1000条均PASS ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9453 | 15 天前 | |
foreach/lamb/scatter类部分算子补齐A5输入校验和资料说明 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !7419 merge master into master foreach/lamb/scatter类部分算子补齐A5输入校验和资料说明 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 foreach/lamb/scatter类部分算子资料描述不清晰,补齐A5输入校验和资料说明 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/4075 ## 测试 不涉及 ## 文档更新 foreach/lamb/scatter类部分算子README文件 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!7419 | 1 个月前 | |
fix(foreach,lamb,scatter_list): ForeachAddc*List 补 Div 0ULP 精度档 + LambApplyOptimizerAssign 支持面订正 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !10142 merge fix/tp-fused-and-scatterlist-doc into master fix(foreach,lamb,scatter_list): ForeachAddc*List 补 Div 0ULP 精度档 + LambApplyOptimizerAssign 支持面订正 Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 本 PR 包含三组修复,均由 TTK 三方精度比对(cross_check)跑批暴露的红灯定位而来。 ### 1. ForeachAddcmulList / ForeachAddcdivList:补 Div 0 ULP 精度档(内核) foreach/foreach_utils/op_kernel/arch35/foreach_addc_list_regbase.h 中的 Div 此前未指定 DivConfig,落到缺省 DivAlgo::INTRINSIC——该档在 dav-3510 上仅保真到 1 ULP。 - 实测 fp32 用例 **23689/524288(4.52%)** 元素与正确舍入结果相差 1 ULP - 在 x1 与 scalars*(x2/x3) 几乎相消的点上,该偏差被放大成上千 ULP 的相对误差,cross_check 的 mare 判据因此报红(实测 mare 29.87 > L1 阈值 5.0) - 显式改用 DivAlgo::PRECISION_0ULP_FTZ_TRUE 后,输出与正确舍入结果**逐位相同(0/524288)** 仓内 20/22 处显式 Div 配置均选 0ULP 档,本文件此前漏配;兄弟算子 foreach_div_list_inplace 已修过同一问题。addcmul 走 Mul 分支不受影响;ComputeIntPath 的整数 Div 未改。 ### 2. LambApplyOptimizerAssign:支持面订正(资料 + host 校验 + UT) 原 README 声明 grad 与 input3 均可小于 inputv/inputm 并向上广播,但底层 Ops::Base 广播模板的 DoDimensionCollapse **不支持对 In0(即 grad)做广播**: - grad 为标量时 EnsureNotScalar 只抬到 {1}、不左补 1 对齐输出 rank → The 1 input's dim num is not same with output's dim num - grad 与输出同 rank 但某维为 1 → The 1 input's dim index is not same with out, and not 1 - 实测支持面矩阵:grad 在任意单维广播均被拒;input3 支持 () / (1,) / (1,1,1) / (4,) / (1,3,4) / (2,1,4),仅 rank 大于输出时不支持 改动: - README 订正为「grad/inputv/inputm 三者 shape 必须完全相同,仅 input3 按右对齐 broadcast 规则向 inputv 对齐」 - infershape 与 tiling 的 CheckInplaceShapeConstraint 同步改为严格等形,使非法组合在 host 阶段被清晰拒绝,而不是放行后到 tiling 阶段抛 E90003 - infershape 三处 shape 校验统一改用结构化日志宏 OP_LOGE_FOR_INVALID_SHAPE(S)_WITH_REASON,与 tiling 侧口径一致 - UT 同步更新:原 moment_shape_decides_output_shape 断言的是旧广播语义,已改为等形;新增 grad_smaller_than_moment_is_rejected 与 input3_broadcast_into_moment_is_accepted ### 3. 三方腿与资料订正(golden / docs) - foreach_add_list_inplace / foreach_sub_list_inplace 的三方腿改用两步拼接(_foreach_mul + _foreach_add),不再用 alpha= 的融合形式。融合形式是一次 FMA 舍入,与 CPU golden 的两步舍入序列不同,两者恒差 1 ULP:实测 107/107 例 |NPU−真值| + |三方−真值| 精确等于 1.0000 ULP,mare 恒为 1.000。分离后三个种子(0/1/7)各 20/20 全通过。 - foreach_addcmul_list / foreach_addcdiv_list 的 golden 补 e2e 三方腿适配类 _TpE2e(TTK 按 torch 重载形参名 self/tensor1/tensor2/scalars 下发,与 def 注册名 x1/x2/x3/scalars 不同,直接复用 kernel 腿竞品类会抛 UnknownParamError);并**标注这两个算子实际不具备 e2e 通路支持**——aten::_foreach_addc{mul,div}.Tensor 在追踪期即抛 Expected scalars to be on CPU,torch.compile 建不了图,torchair converter 走不到,需手工给已安装的 torch_npu 补 meta 注册才能跑通,该补丁不在本仓、重装即失效,故不作为已交付通路。 - ScatterList 资料补 maskOptional 取值范围,并修正 mask 维度列笔误(0-8 → 1 维);aclnnScatterMin 补索引取值范围;op_api_list 补 ForeachAddcmul/AddcdivList 的确定性说明。 ## 关联的Issue 关联 Issue #5750 —— https://gitcode.com/cann/ops-nn/issues/5750 ## 测试 - **LambApplyOptimizerAssign op_host UT**:bash build.sh -u --ops=lamb_apply_optimizer_assign --soc=ascend950 → **14/14 PASSED**(含 2 条新增用例) - **Div 精度档位(JIT 在线编译,源码级 A/B)**:同用例同区间下,改前 23689/524288(4.518%)元素偏离正确舍入,改后 **0/524288** - **部署二进制验证(重新出包 + 部署,确认被测 == 当前源码)**:ForeachAddcdivList 在 kernel / aclnn / GE 图三条通路上 mare = mere = rmse = 1(即与 golden 逐位相同) - **LambApplyOptimizerAssign 支持面矩阵(静态 GE 通路)**:grad 等形 + input3 降 rank 用例 PASS;grad 标量 / grad 含 1 维用例在 host 阶段被拒,报错文案为 Parameter grad of op1 has incorrect shape [1]. Reason: grad does not support broadcast and must have exactly the same shape as inputv/inputm - **pre-commit**:clang-format / ruff-check / ruff-format / codespell / trailing-whitespace / end-of-file-fixer 本地全部通过 - ⚠️ **待补**:foreach_addcdiv_list(1437 例)与 lamb_apply_optimizer_assign 泛化集回归正在跑批中,结果将补充到本 PR 评论 ## 文档更新 - optim/lamb_apply_optimizer_assign/README.md:输入/输出 shape 描述与《约束说明》改写 - index/scatter_list/README.md、index/scatter_list/docs/aclnnScatterList.md:mask 取值范围与维度笔误订正 - docs/zh/op_api_list.md:补 ForeachAddcmul/AddcdivList 确定性说明 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!10142 | 3 天前 | |
fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Co-authored-by: pingchuantang<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9994 merge fix/golden-empty-tensor-and-int-path into master fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Created-by: zl_hw Commit-by: pingchuantang Merged-by: cann-robot Description: ## 描述 修正 11 个 foreach / scatter / lamb 算子 tests/assets/golden.py 的四类缺陷。这些缺陷不改变算子行为, 但会让 TTK cross_check 三方比对的结论失真,部分 dtype 的精度结论从未被真正验证过。 **1) 空张量崩溃(scatter 类)** var 或 updates 的 numel 为 0 时 golden 抛异常。算子侧对空张量按结构合法放行 (scatter_reduce_common_tiling.cpp 放行,scatter_reduce_common_simt.h 在 sliceSize == 0 时 Init/Process 为 no-op),golden 改为同口径短路返回。 **2) 整型参照失真** 三方腿把整型入参强转 fp32 再计算;fp32 尾数 24 位,>2^24 的 int32 静默丢低位 (2^30+100 → 2^30+128)。改为整型进整型出。 **3) 三方标杆与 golden 逐位相等 → 双标杆塌陷** golden 侧 _to_fp32/_t 无条件 astype("float32") 撤销了 TTK 的 Promote;三方侧 .to(torch.float32) 抬档后不回窄。两者叠加使 golden 与 third_party 逐位相同(实测 ttk-compare.log 3200/3200 行 |b-g| = 0),cross_check 三比值的分母被夹到精度标准 §4.5.1 的 err,无量纲的 mare/mere 仍小, 而有量纲的 **RMSE 比值随输出量级线性放大** → 假红(实测最高 **2348.6 / 166.1**)。 修复:golden 跟随 Promote **不做任何 cast**;三方按内核算法转写(见 4)。 **4) 三方 compose 与被测内核算法不对等** - **4.1 中间量精度**:内核是融合 DAG —— 窄类型入参先 Cast<U,T,0> 加宽到 U(=float),十几步中间量 全程留在 fp32,最后 Cast<T,U,1> / NarrowStore 窄回(依据:lamb_next_m_v_dag.h:44 "Compute in U (=float)";scatter_reduce_common_simt.h "ACC: float for fp16" + LoadWiden/NarrowStore)。 而 torch 只在**单个算子内部**用 opmath=float,**算子之间**每一步都把结果落回窄类型 (A100 实测:fp16 下 300*300 直接得 inf,而 (a*a)/a 真值 300 明明存得下)。 三方遂在窄类型上逐步溢出,产生 golden/NPU 都没有的 inf/nan。 修复:入口加宽 + 出口窄回,**两者必须成对** —— 缺加宽则溢出,缺窄回则回到缺陷 3 的塌陷。 - **4.2 运算序列**:compose 用 torch.addcmul 的融合 FMA(单次舍入),而内核是 Add(Mul(V,B2), Mul(G2,OmB2))(两次独立乘法 + 一次加法,三次舍入)。竞品凭空更准, ratio = NPU误差/竞品误差 把内核判成缺陷。修复为与内核逐字对应的分步拼接。 **不变量**:只改 third_party(设备侧竞品腿)与 golden 的 dtype 口径,**不改任何算子语义**; CPU golden 不含任何 cast,由 TTK 的 Promote 单独喂高精度输入,两条腿在 TTK 侧本就分离 (golden 收 Promote 后输入,third_party 收 original_input_arrays)。 **受影响算子(11 个)**:foreach_addcdiv_list、foreach_addcmul_list、scatter_div、scatter_max、 scatter_min、scatter_mul、lamb_apply_weight_assign、lamb_next_m_v、lamb_next_m_v_with_decay、 lamb_next_right、lamb_update_with_lr_v2 ## 关联的Issue 关联 Issue #5635 ## 测试 TTK GEIR 通路真机验证(Atlas A5 / ascend950,CANN 9.2.0,三方标杆 A100-PCIE-40GB + torch 2.13.0+cu126), **11 个算子 / 66 例全部 PASS,三比值零超标**。用例覆盖 fp16 / bf16 / fp32 / int8 / uint8 / int32 各档, 以及空张量、inf、near-zero 边界。 修复前后对照(同一用例集): | 算子 | 修复前典型失败 | 修复后 | |---|---|---| | foreach_addcdiv_list | bf16 rmse 比值 20.92、fp32 mare 比值 88.65 | 6/6 PASS | | foreach_addcmul_list | bf16 rmse 比值 166.10 | 6/6 PASS | | scatter_mul | fp32 rmse 比值 116.27 + NaN/Inf mismatch | 10/10 PASS | | scatter_min / scatter_div / scatter_max | — | 6/6、10/10、10/10 PASS | | lamb_next_m_v | rmse 塌陷 + NaN/Inf mismatch + fp32 mare 6.20 | 4/4 PASS | | lamb_next_right | fp16 rmse 比值 20.28 | 3/3 PASS | | lamb_next_m_v_with_decay | — | 4/4 PASS | | lamb_apply_weight_assign | fp16 rmse 比值 9.03 | 3/3 PASS | | lamb_update_with_lr_v2 | 测试方原用例(changwei issue #87) | 4/4 PASS | 跑批命令: bash python3 -m ttk geir -i <用例集>.csv --plugin <算子>/tests/assets/golden.py \ --device-whitelist=0 -d -b -c=false --seed 12345 ## 文档更新 无。本 PR 只改 tests/assets/golden.py,不涉及算子实现、原型、资料。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9994 | 5 天前 | |
fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Co-authored-by: pingchuantang<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9994 merge fix/golden-empty-tensor-and-int-path into master fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Created-by: zl_hw Commit-by: pingchuantang Merged-by: cann-robot Description: ## 描述 修正 11 个 foreach / scatter / lamb 算子 tests/assets/golden.py 的四类缺陷。这些缺陷不改变算子行为, 但会让 TTK cross_check 三方比对的结论失真,部分 dtype 的精度结论从未被真正验证过。 **1) 空张量崩溃(scatter 类)** var 或 updates 的 numel 为 0 时 golden 抛异常。算子侧对空张量按结构合法放行 (scatter_reduce_common_tiling.cpp 放行,scatter_reduce_common_simt.h 在 sliceSize == 0 时 Init/Process 为 no-op),golden 改为同口径短路返回。 **2) 整型参照失真** 三方腿把整型入参强转 fp32 再计算;fp32 尾数 24 位,>2^24 的 int32 静默丢低位 (2^30+100 → 2^30+128)。改为整型进整型出。 **3) 三方标杆与 golden 逐位相等 → 双标杆塌陷** golden 侧 _to_fp32/_t 无条件 astype("float32") 撤销了 TTK 的 Promote;三方侧 .to(torch.float32) 抬档后不回窄。两者叠加使 golden 与 third_party 逐位相同(实测 ttk-compare.log 3200/3200 行 |b-g| = 0),cross_check 三比值的分母被夹到精度标准 §4.5.1 的 err,无量纲的 mare/mere 仍小, 而有量纲的 **RMSE 比值随输出量级线性放大** → 假红(实测最高 **2348.6 / 166.1**)。 修复:golden 跟随 Promote **不做任何 cast**;三方按内核算法转写(见 4)。 **4) 三方 compose 与被测内核算法不对等** - **4.1 中间量精度**:内核是融合 DAG —— 窄类型入参先 Cast<U,T,0> 加宽到 U(=float),十几步中间量 全程留在 fp32,最后 Cast<T,U,1> / NarrowStore 窄回(依据:lamb_next_m_v_dag.h:44 "Compute in U (=float)";scatter_reduce_common_simt.h "ACC: float for fp16" + LoadWiden/NarrowStore)。 而 torch 只在**单个算子内部**用 opmath=float,**算子之间**每一步都把结果落回窄类型 (A100 实测:fp16 下 300*300 直接得 inf,而 (a*a)/a 真值 300 明明存得下)。 三方遂在窄类型上逐步溢出,产生 golden/NPU 都没有的 inf/nan。 修复:入口加宽 + 出口窄回,**两者必须成对** —— 缺加宽则溢出,缺窄回则回到缺陷 3 的塌陷。 - **4.2 运算序列**:compose 用 torch.addcmul 的融合 FMA(单次舍入),而内核是 Add(Mul(V,B2), Mul(G2,OmB2))(两次独立乘法 + 一次加法,三次舍入)。竞品凭空更准, ratio = NPU误差/竞品误差 把内核判成缺陷。修复为与内核逐字对应的分步拼接。 **不变量**:只改 third_party(设备侧竞品腿)与 golden 的 dtype 口径,**不改任何算子语义**; CPU golden 不含任何 cast,由 TTK 的 Promote 单独喂高精度输入,两条腿在 TTK 侧本就分离 (golden 收 Promote 后输入,third_party 收 original_input_arrays)。 **受影响算子(11 个)**:foreach_addcdiv_list、foreach_addcmul_list、scatter_div、scatter_max、 scatter_min、scatter_mul、lamb_apply_weight_assign、lamb_next_m_v、lamb_next_m_v_with_decay、 lamb_next_right、lamb_update_with_lr_v2 ## 关联的Issue 关联 Issue #5635 ## 测试 TTK GEIR 通路真机验证(Atlas A5 / ascend950,CANN 9.2.0,三方标杆 A100-PCIE-40GB + torch 2.13.0+cu126), **11 个算子 / 66 例全部 PASS,三比值零超标**。用例覆盖 fp16 / bf16 / fp32 / int8 / uint8 / int32 各档, 以及空张量、inf、near-zero 边界。 修复前后对照(同一用例集): | 算子 | 修复前典型失败 | 修复后 | |---|---|---| | foreach_addcdiv_list | bf16 rmse 比值 20.92、fp32 mare 比值 88.65 | 6/6 PASS | | foreach_addcmul_list | bf16 rmse 比值 166.10 | 6/6 PASS | | scatter_mul | fp32 rmse 比值 116.27 + NaN/Inf mismatch | 10/10 PASS | | scatter_min / scatter_div / scatter_max | — | 6/6、10/10、10/10 PASS | | lamb_next_m_v | rmse 塌陷 + NaN/Inf mismatch + fp32 mare 6.20 | 4/4 PASS | | lamb_next_right | fp16 rmse 比值 20.28 | 3/3 PASS | | lamb_next_m_v_with_decay | — | 4/4 PASS | | lamb_apply_weight_assign | fp16 rmse 比值 9.03 | 3/3 PASS | | lamb_update_with_lr_v2 | 测试方原用例(changwei issue #87) | 4/4 PASS | 跑批命令: bash python3 -m ttk geir -i <用例集>.csv --plugin <算子>/tests/assets/golden.py \ --device-whitelist=0 -d -b -c=false --seed 12345 ## 文档更新 无。本 PR 只改 tests/assets/golden.py,不涉及算子实现、原型、资料。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9994 | 5 天前 | |
fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Co-authored-by: pingchuantang<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9994 merge fix/golden-empty-tensor-and-int-path into master fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Created-by: zl_hw Commit-by: pingchuantang Merged-by: cann-robot Description: ## 描述 修正 11 个 foreach / scatter / lamb 算子 tests/assets/golden.py 的四类缺陷。这些缺陷不改变算子行为, 但会让 TTK cross_check 三方比对的结论失真,部分 dtype 的精度结论从未被真正验证过。 **1) 空张量崩溃(scatter 类)** var 或 updates 的 numel 为 0 时 golden 抛异常。算子侧对空张量按结构合法放行 (scatter_reduce_common_tiling.cpp 放行,scatter_reduce_common_simt.h 在 sliceSize == 0 时 Init/Process 为 no-op),golden 改为同口径短路返回。 **2) 整型参照失真** 三方腿把整型入参强转 fp32 再计算;fp32 尾数 24 位,>2^24 的 int32 静默丢低位 (2^30+100 → 2^30+128)。改为整型进整型出。 **3) 三方标杆与 golden 逐位相等 → 双标杆塌陷** golden 侧 _to_fp32/_t 无条件 astype("float32") 撤销了 TTK 的 Promote;三方侧 .to(torch.float32) 抬档后不回窄。两者叠加使 golden 与 third_party 逐位相同(实测 ttk-compare.log 3200/3200 行 |b-g| = 0),cross_check 三比值的分母被夹到精度标准 §4.5.1 的 err,无量纲的 mare/mere 仍小, 而有量纲的 **RMSE 比值随输出量级线性放大** → 假红(实测最高 **2348.6 / 166.1**)。 修复:golden 跟随 Promote **不做任何 cast**;三方按内核算法转写(见 4)。 **4) 三方 compose 与被测内核算法不对等** - **4.1 中间量精度**:内核是融合 DAG —— 窄类型入参先 Cast<U,T,0> 加宽到 U(=float),十几步中间量 全程留在 fp32,最后 Cast<T,U,1> / NarrowStore 窄回(依据:lamb_next_m_v_dag.h:44 "Compute in U (=float)";scatter_reduce_common_simt.h "ACC: float for fp16" + LoadWiden/NarrowStore)。 而 torch 只在**单个算子内部**用 opmath=float,**算子之间**每一步都把结果落回窄类型 (A100 实测:fp16 下 300*300 直接得 inf,而 (a*a)/a 真值 300 明明存得下)。 三方遂在窄类型上逐步溢出,产生 golden/NPU 都没有的 inf/nan。 修复:入口加宽 + 出口窄回,**两者必须成对** —— 缺加宽则溢出,缺窄回则回到缺陷 3 的塌陷。 - **4.2 运算序列**:compose 用 torch.addcmul 的融合 FMA(单次舍入),而内核是 Add(Mul(V,B2), Mul(G2,OmB2))(两次独立乘法 + 一次加法,三次舍入)。竞品凭空更准, ratio = NPU误差/竞品误差 把内核判成缺陷。修复为与内核逐字对应的分步拼接。 **不变量**:只改 third_party(设备侧竞品腿)与 golden 的 dtype 口径,**不改任何算子语义**; CPU golden 不含任何 cast,由 TTK 的 Promote 单独喂高精度输入,两条腿在 TTK 侧本就分离 (golden 收 Promote 后输入,third_party 收 original_input_arrays)。 **受影响算子(11 个)**:foreach_addcdiv_list、foreach_addcmul_list、scatter_div、scatter_max、 scatter_min、scatter_mul、lamb_apply_weight_assign、lamb_next_m_v、lamb_next_m_v_with_decay、 lamb_next_right、lamb_update_with_lr_v2 ## 关联的Issue 关联 Issue #5635 ## 测试 TTK GEIR 通路真机验证(Atlas A5 / ascend950,CANN 9.2.0,三方标杆 A100-PCIE-40GB + torch 2.13.0+cu126), **11 个算子 / 66 例全部 PASS,三比值零超标**。用例覆盖 fp16 / bf16 / fp32 / int8 / uint8 / int32 各档, 以及空张量、inf、near-zero 边界。 修复前后对照(同一用例集): | 算子 | 修复前典型失败 | 修复后 | |---|---|---| | foreach_addcdiv_list | bf16 rmse 比值 20.92、fp32 mare 比值 88.65 | 6/6 PASS | | foreach_addcmul_list | bf16 rmse 比值 166.10 | 6/6 PASS | | scatter_mul | fp32 rmse 比值 116.27 + NaN/Inf mismatch | 10/10 PASS | | scatter_min / scatter_div / scatter_max | — | 6/6、10/10、10/10 PASS | | lamb_next_m_v | rmse 塌陷 + NaN/Inf mismatch + fp32 mare 6.20 | 4/4 PASS | | lamb_next_right | fp16 rmse 比值 20.28 | 3/3 PASS | | lamb_next_m_v_with_decay | — | 4/4 PASS | | lamb_apply_weight_assign | fp16 rmse 比值 9.03 | 3/3 PASS | | lamb_update_with_lr_v2 | 测试方原用例(changwei issue #87) | 4/4 PASS | 跑批命令: bash python3 -m ttk geir -i <用例集>.csv --plugin <算子>/tests/assets/golden.py \ --device-whitelist=0 -d -b -c=false --seed 12345 ## 文档更新 无。本 PR 只改 tests/assets/golden.py,不涉及算子实现、原型、资料。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9994 | 5 天前 | |
fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Co-authored-by: pingchuantang<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9994 merge fix/golden-empty-tensor-and-int-path into master fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Created-by: zl_hw Commit-by: pingchuantang Merged-by: cann-robot Description: ## 描述 修正 11 个 foreach / scatter / lamb 算子 tests/assets/golden.py 的四类缺陷。这些缺陷不改变算子行为, 但会让 TTK cross_check 三方比对的结论失真,部分 dtype 的精度结论从未被真正验证过。 **1) 空张量崩溃(scatter 类)** var 或 updates 的 numel 为 0 时 golden 抛异常。算子侧对空张量按结构合法放行 (scatter_reduce_common_tiling.cpp 放行,scatter_reduce_common_simt.h 在 sliceSize == 0 时 Init/Process 为 no-op),golden 改为同口径短路返回。 **2) 整型参照失真** 三方腿把整型入参强转 fp32 再计算;fp32 尾数 24 位,>2^24 的 int32 静默丢低位 (2^30+100 → 2^30+128)。改为整型进整型出。 **3) 三方标杆与 golden 逐位相等 → 双标杆塌陷** golden 侧 _to_fp32/_t 无条件 astype("float32") 撤销了 TTK 的 Promote;三方侧 .to(torch.float32) 抬档后不回窄。两者叠加使 golden 与 third_party 逐位相同(实测 ttk-compare.log 3200/3200 行 |b-g| = 0),cross_check 三比值的分母被夹到精度标准 §4.5.1 的 err,无量纲的 mare/mere 仍小, 而有量纲的 **RMSE 比值随输出量级线性放大** → 假红(实测最高 **2348.6 / 166.1**)。 修复:golden 跟随 Promote **不做任何 cast**;三方按内核算法转写(见 4)。 **4) 三方 compose 与被测内核算法不对等** - **4.1 中间量精度**:内核是融合 DAG —— 窄类型入参先 Cast<U,T,0> 加宽到 U(=float),十几步中间量 全程留在 fp32,最后 Cast<T,U,1> / NarrowStore 窄回(依据:lamb_next_m_v_dag.h:44 "Compute in U (=float)";scatter_reduce_common_simt.h "ACC: float for fp16" + LoadWiden/NarrowStore)。 而 torch 只在**单个算子内部**用 opmath=float,**算子之间**每一步都把结果落回窄类型 (A100 实测:fp16 下 300*300 直接得 inf,而 (a*a)/a 真值 300 明明存得下)。 三方遂在窄类型上逐步溢出,产生 golden/NPU 都没有的 inf/nan。 修复:入口加宽 + 出口窄回,**两者必须成对** —— 缺加宽则溢出,缺窄回则回到缺陷 3 的塌陷。 - **4.2 运算序列**:compose 用 torch.addcmul 的融合 FMA(单次舍入),而内核是 Add(Mul(V,B2), Mul(G2,OmB2))(两次独立乘法 + 一次加法,三次舍入)。竞品凭空更准, ratio = NPU误差/竞品误差 把内核判成缺陷。修复为与内核逐字对应的分步拼接。 **不变量**:只改 third_party(设备侧竞品腿)与 golden 的 dtype 口径,**不改任何算子语义**; CPU golden 不含任何 cast,由 TTK 的 Promote 单独喂高精度输入,两条腿在 TTK 侧本就分离 (golden 收 Promote 后输入,third_party 收 original_input_arrays)。 **受影响算子(11 个)**:foreach_addcdiv_list、foreach_addcmul_list、scatter_div、scatter_max、 scatter_min、scatter_mul、lamb_apply_weight_assign、lamb_next_m_v、lamb_next_m_v_with_decay、 lamb_next_right、lamb_update_with_lr_v2 ## 关联的Issue 关联 Issue #5635 ## 测试 TTK GEIR 通路真机验证(Atlas A5 / ascend950,CANN 9.2.0,三方标杆 A100-PCIE-40GB + torch 2.13.0+cu126), **11 个算子 / 66 例全部 PASS,三比值零超标**。用例覆盖 fp16 / bf16 / fp32 / int8 / uint8 / int32 各档, 以及空张量、inf、near-zero 边界。 修复前后对照(同一用例集): | 算子 | 修复前典型失败 | 修复后 | |---|---|---| | foreach_addcdiv_list | bf16 rmse 比值 20.92、fp32 mare 比值 88.65 | 6/6 PASS | | foreach_addcmul_list | bf16 rmse 比值 166.10 | 6/6 PASS | | scatter_mul | fp32 rmse 比值 116.27 + NaN/Inf mismatch | 10/10 PASS | | scatter_min / scatter_div / scatter_max | — | 6/6、10/10、10/10 PASS | | lamb_next_m_v | rmse 塌陷 + NaN/Inf mismatch + fp32 mare 6.20 | 4/4 PASS | | lamb_next_right | fp16 rmse 比值 20.28 | 3/3 PASS | | lamb_next_m_v_with_decay | — | 4/4 PASS | | lamb_apply_weight_assign | fp16 rmse 比值 9.03 | 3/3 PASS | | lamb_update_with_lr_v2 | 测试方原用例(changwei issue #87) | 4/4 PASS | 跑批命令: bash python3 -m ttk geir -i <用例集>.csv --plugin <算子>/tests/assets/golden.py \ --device-whitelist=0 -d -b -c=false --seed 12345 ## 文档更新 无。本 PR 只改 tests/assets/golden.py,不涉及算子实现、原型、资料。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9994 | 5 天前 | |
fix(scatter,foreach): 修复 ScatterMax/Min/Mul/Div 排序竞态与 Div 精度档,并整改 12 个算子 golden Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !10059 merge fix/golden-third-party-precision-batch2 into master fix(scatter,foreach): 修复 ScatterMax/Min/Mul/Div 排序竞态与 Div 精度档,并整改 12 个算子 golden Created-by: zl_hw Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 修复 ScatterMax/Min/Mul/Div 排序阶段的多核同步缺口与 foreach_div_list_inplace 的除法精度档, 并整改 12 个 foreach/scatter/lamb 算子 tests/assets/golden.py 的四类缺陷、补齐 2 处资料。 ### 一、内核缺陷 **1) scatter_reduce_common 并行归并排序缺少 MTE3->V / MTE3->S 同步(竞态)** SortLocalRuns() 循环尾只发 MTE3->MTE2(保护下一轮的输入搬入),未约束下一轮的 V 管道(Sort/Adds)与 S 管道(补哨兵)—— 而它们写的正是同一对 UB shiftSorted / originUb,本轮把它们搬出到 GM 的 DataCopyPad(MTE3) 尚未读完就被覆写, 导致落盘的排序键与原位置索引被污染,少数 var 行折进别行的 update。 旁证:同文件 SortMergeTree() 循环尾发的是 MTE3->S(它只用 S 写 UB,够用), 反衬出 SortLocalRuns() 漏了两条。 修复: cpp + const event_t m3v = pipe_.FetchEventID(HardEvent::MTE3_V); + const event_t m3s2 = pipe_.FetchEventID(HardEvent::MTE3_S); ... SetFlag<MTE3_MTE2>(m3m2); WaitFlag<MTE3_MTE2>(m3m2); + SetFlag<MTE3_V>(m3v); WaitFlag<MTE3_V>(m3v); + SetFlag<MTE3_S>(m3s2); WaitFlag<MTE3_S>(m3s2); **A/B 同种子对照**(var 6288948 行 / M 5375 万 / 合法索引 / 8 个固定种子,其余完全相同): | | 修复前 | 修复后 | |---|---:|---:| | PASS | 2 | **8** | | FAIL | 6 | **0** | 原触发用例连跑 3 遍 3/3 全绿(修复前每次必红)。ScatterMin 同规模复跑 3/3 全绿。 影响面:该内核为 ScatterMax/Min/Mul/Div 共享(Process() 中 MAX/MIN/MUL 走完全相同的路径, DIV 共用排序阶段),四个算子一并修复;位于 op_kernel/arch35/ 专属目录,不影响 A2。 **2) foreach_div_list_inplace 未开启 Div 的 0 ULP 精度档** Div(...) 未传 DivConfig,落到 DEFAULT_DIV_CONFIG = {DivAlgo::INTRINSIC}; 在 dav-3510 上该档是 1 ULP 保真舍入(实测 3126 万个 fp32 元素中 **8.29% 偏 1 ULP**), 而竞品 fp32 除法为 0 ULP 正确舍入。显式选 PRECISION_0ULP_FTZ_TRUE: | | 偏 0 ULP | 偏 1 ULP | 最大偏差 | |---|---:|---:|---:| | 修改前 | 91.71% | 8.29% | 1 ULP | | 修改后 | **100.0000%** | **0%** | **0 ULP** | 全泛化集 34/34 通过,性能 +4.2%(--run 12 同条件实测 209.8us -> 218.7us)。 未取仓内他处常见的 FTZ_FALSE:两档精度实测完全相同,但 FTZ_FALSE 的非规格数完整处理 同条件实测 218.7us -> 2028.1us(**9.3x**),而本算子输入域内不产生 fp32 非规格数。 ### 二、golden 整改(12 个算子) **3) Promote 撤销** —— _to_fp32 无条件把 Promote 后的 float64 砍回 fp32,等于撤销 TTK 的 Promote 能力:fp32 档的 mare 恒等于地板值 0.0019531(= 1ULP / 2^-14),无论内核对错都过, **该档等于从未被验证**。加 float64 护栏(CPU 侧不 cast,来什么算什么)。 **4) 三方腿入参绑定失效** —— _TpKernelFaithful 包装遮蔽了真实签名,TTK 按 __call__ 签名 绑定入参导致 TypeError,三方腿整条不可用。透传 __signature__ 修复。 **5) TensorList 载体还原** —— bf16 以 void 视图传入,torch 不认,按位 view 回 bf16(同宽无损)。 **6) 标量重载** —— torch 的 foreach 标量重载只接受 Number,Python 标量是 weak-typed 不会抬高 dtype,改为返回 Python 数值。 **7) scatter_list 的 uint16/uint32 崩溃** —— 走 torch index_put 会抛异常,改用等宽有符号 位视图(uint16->int16、uint32->int32)规避。 **8) scatter_div 工作 dtype** —— 由硬编码 fp32 改为跟随输入(仅保留 bf16->fp32 的载体桥接)。 **9) scatter_max/min/mul/div 的 tf 三方腿按内核算法转写** —— 内核对 fp16 是 LoadWiden 到 fp32 计算、NarrowStore 窄回,原实现只在窄类型上算,与被测内核不是同一个算法。 ### 三、资料 **10)** aclnnScatterMin.md 补齐索引取值范围约束(索引值的取值范围为[0, varRef.shape[0]))—— 该条 Max/Mul/Div 三个算子的资料原本就有,仅 Min 的约束列为空,属资料内部不一致。 **11)** aclnnScatterList.md 补充 maskOptional 取值范围(措辞与既有的 indice 取值条款对齐), 并修正参数表 mask 维度列笔误(原写 0-8,实际实现仅支持 1 维,tiling 对 maskDims != 1 直接返回 GRAPH_FAILED)。 ## 验证 | 项 | 结果 | |---|---| | ScatterMax 排序竞态 A/B(同 8 种子) | 修复前 2/8 通过 → 修复后 **8/8 通过** | | ScatterMin 同规模复跑 | **3/3 通过** | | foreach_div 全泛化集 | **34/34 通过**,3126 万元素 100% 偏 0 ULP | | 12 个算子 kernel + geir 双通路 | **1646 例,除已修复项外全部通过** | | ScatterMax/Min aclnn 通路 | **2/2、2/2 通过**(GetWorkspaceSize 与 OnXpuProfiling 均命中) | | CI 门禁 | ruff check / ruff format 全部通过 | 关联 Issue #5682 See merge request: cann/ops-nn!10059 | 5 天前 | |
fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Co-authored-by: pingchuantang<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !9994 merge fix/golden-empty-tensor-and-int-path into master fix(assets): 修正 11 个算子 golden 的四类缺陷——空张量崩溃、整型参照失真、三方标杆塌陷与算法不对等 Created-by: zl_hw Commit-by: pingchuantang Merged-by: cann-robot Description: ## 描述 修正 11 个 foreach / scatter / lamb 算子 tests/assets/golden.py 的四类缺陷。这些缺陷不改变算子行为, 但会让 TTK cross_check 三方比对的结论失真,部分 dtype 的精度结论从未被真正验证过。 **1) 空张量崩溃(scatter 类)** var 或 updates 的 numel 为 0 时 golden 抛异常。算子侧对空张量按结构合法放行 (scatter_reduce_common_tiling.cpp 放行,scatter_reduce_common_simt.h 在 sliceSize == 0 时 Init/Process 为 no-op),golden 改为同口径短路返回。 **2) 整型参照失真** 三方腿把整型入参强转 fp32 再计算;fp32 尾数 24 位,>2^24 的 int32 静默丢低位 (2^30+100 → 2^30+128)。改为整型进整型出。 **3) 三方标杆与 golden 逐位相等 → 双标杆塌陷** golden 侧 _to_fp32/_t 无条件 astype("float32") 撤销了 TTK 的 Promote;三方侧 .to(torch.float32) 抬档后不回窄。两者叠加使 golden 与 third_party 逐位相同(实测 ttk-compare.log 3200/3200 行 |b-g| = 0),cross_check 三比值的分母被夹到精度标准 §4.5.1 的 err,无量纲的 mare/mere 仍小, 而有量纲的 **RMSE 比值随输出量级线性放大** → 假红(实测最高 **2348.6 / 166.1**)。 修复:golden 跟随 Promote **不做任何 cast**;三方按内核算法转写(见 4)。 **4) 三方 compose 与被测内核算法不对等** - **4.1 中间量精度**:内核是融合 DAG —— 窄类型入参先 Cast<U,T,0> 加宽到 U(=float),十几步中间量 全程留在 fp32,最后 Cast<T,U,1> / NarrowStore 窄回(依据:lamb_next_m_v_dag.h:44 "Compute in U (=float)";scatter_reduce_common_simt.h "ACC: float for fp16" + LoadWiden/NarrowStore)。 而 torch 只在**单个算子内部**用 opmath=float,**算子之间**每一步都把结果落回窄类型 (A100 实测:fp16 下 300*300 直接得 inf,而 (a*a)/a 真值 300 明明存得下)。 三方遂在窄类型上逐步溢出,产生 golden/NPU 都没有的 inf/nan。 修复:入口加宽 + 出口窄回,**两者必须成对** —— 缺加宽则溢出,缺窄回则回到缺陷 3 的塌陷。 - **4.2 运算序列**:compose 用 torch.addcmul 的融合 FMA(单次舍入),而内核是 Add(Mul(V,B2), Mul(G2,OmB2))(两次独立乘法 + 一次加法,三次舍入)。竞品凭空更准, ratio = NPU误差/竞品误差 把内核判成缺陷。修复为与内核逐字对应的分步拼接。 **不变量**:只改 third_party(设备侧竞品腿)与 golden 的 dtype 口径,**不改任何算子语义**; CPU golden 不含任何 cast,由 TTK 的 Promote 单独喂高精度输入,两条腿在 TTK 侧本就分离 (golden 收 Promote 后输入,third_party 收 original_input_arrays)。 **受影响算子(11 个)**:foreach_addcdiv_list、foreach_addcmul_list、scatter_div、scatter_max、 scatter_min、scatter_mul、lamb_apply_weight_assign、lamb_next_m_v、lamb_next_m_v_with_decay、 lamb_next_right、lamb_update_with_lr_v2 ## 关联的Issue 关联 Issue #5635 ## 测试 TTK GEIR 通路真机验证(Atlas A5 / ascend950,CANN 9.2.0,三方标杆 A100-PCIE-40GB + torch 2.13.0+cu126), **11 个算子 / 66 例全部 PASS,三比值零超标**。用例覆盖 fp16 / bf16 / fp32 / int8 / uint8 / int32 各档, 以及空张量、inf、near-zero 边界。 修复前后对照(同一用例集): | 算子 | 修复前典型失败 | 修复后 | |---|---|---| | foreach_addcdiv_list | bf16 rmse 比值 20.92、fp32 mare 比值 88.65 | 6/6 PASS | | foreach_addcmul_list | bf16 rmse 比值 166.10 | 6/6 PASS | | scatter_mul | fp32 rmse 比值 116.27 + NaN/Inf mismatch | 10/10 PASS | | scatter_min / scatter_div / scatter_max | — | 6/6、10/10、10/10 PASS | | lamb_next_m_v | rmse 塌陷 + NaN/Inf mismatch + fp32 mare 6.20 | 4/4 PASS | | lamb_next_right | fp16 rmse 比值 20.28 | 3/3 PASS | | lamb_next_m_v_with_decay | — | 4/4 PASS | | lamb_apply_weight_assign | fp16 rmse 比值 9.03 | 3/3 PASS | | lamb_update_with_lr_v2 | 测试方原用例(changwei issue #87) | 4/4 PASS | 跑批命令: bash python3 -m ttk geir -i <用例集>.csv --plugin <算子>/tests/assets/golden.py \ --device-whitelist=0 -d -b -c=false --seed 12345 ## 文档更新 无。本 PR 只改 tests/assets/golden.py,不涉及算子实现、原型、资料。 ## 类型标签 - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!9994 | 5 天前 | |
legacy下线:整改NN算子图模式注册与日志规范 Co-authored-by: zhouxuan78<zhouxuan78@huawei.com> # message auto-generated for no-merge-commit merge: !8388 merge master into master legacy下线:整改NN算子图模式注册与日志规范 Created-by: zhouxuan78 Commit-by: zhouxuan78 Merged-by: cann-robot Description: ## 描述 本 PR 用于 ops-nn 仓 Legacy 下线整改,补齐部分算子的直调/图模式注册、InferShape / InferDataType 拆分、日志规范整改及必要的编译/预提交问题修复。 1. 补齐多个算子的 op_graph 侧 InferDataType / graph infer 注册文件,并同步补充对应 CMakeLists.txt: - 如 FastGeluV2、HardShrinkGrad、HardSigmoidGrad、HardSwish、HardSwishGrad、Selu、SeluGrad、Shrink、SoftplusGrad、SoftplusV2、SoftplusV2Grad、Softsign、SoftsignGrad、SmoothL1Loss、SoftMarginLoss、LpNormUpdateV2、ApplyFtrlV2、ApplyMomentum、ApplyRMSProp 等。 2. 调整部分算子的 op_host infer 文件: - 将 InferDataType 逻辑从 infershape 文件中拆分/迁移到 op_graph 侧; - 保留 InferShape 逻辑,避免 shape/type 混在同一处注册; - 收敛 IndexCheck infershape 日志,仅保留入口日志。 3. 补充 SoftMarginLoss 图模式原型: - 新增 loss/soft_margin_loss/op_graph/soft_margin_loss_proto.h; - 新增 OPS_PROTO_DEF_SOFTMARGINLOSS 去重宏,避免重复注册; - 补充 SoftMarginLoss 的 op_graph/CMakeLists.txt 和 graph infer 注册。 4. 日志整改: - 为 Arch35 tiling 入口补充统一入口日志; - 对本 PR 修改范围内新增/调整的外部输入错误日志,按规范使用 OP_LOGE_FOR_INVALID_* 系列上报接口; - 收敛部分过多的 tiling / infershape 日志打印,避免循环或冗余打印。 5. 回退/收敛不属于本次整改范围的 Softshrink 重命名相关改动: - Softshrink -> SoftShrink 的命名调整不放在本 PR 中,后续单独 PR 处理。 6. 修复 pre-commit 格式问题: - 按仓库 .clang-format 修复格式; - 不修改 .pre-commit-config.yaml。 影响范围 主要影响 activation、index、loss、norm、optim、quant、vfusion 等目录下 Legacy 下线相关算子的 op_graph 注册、InferDataType 拆分、tiling 入口日志和错误日志规范。 ## 变更内容 ## 关联的Issue ## 测试 ## 文档更新 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他:Legacy包下线整改 See merge request: cann/ops-nn!8388 | 4 天前 | |
docs(sgd): fix non-standard scalar shape description in README Co-authored-by: raoliang_sac<raoliang4@huawei.com> # message auto-generated for no-merge-commit merge: !8512 merge fix/issue-4680-sgd-readme into master docs(sgd): fix non-standard scalar shape description in README Created-by: raoliang_sac Commit-by: raoliang_sac Merged-by: cann-robot Description: ## 描述 修改 optim/sgd/README.md 中 learning_rate 和 momentum 参数的 shape 描述,将不符合文档标准的 "shape须为0维标量,或元素总数为1的tensor(如[1]、[1,1])" 改为标准的 "标量(元素个数为1)",与仓库其他算子的描述风格对齐。 ## 关联的Issue Fixes #4680 ## 测试 仅文档修改,无代码逻辑变更,无需测试。 ## 文档更新 更新了 optim/sgd/README.md 中 learning_rate 和 momentum 参数的 shape 约束描述。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 - [x] AI辅助编写 See merge request: cann/ops-nn!8512 | 1 个月前 | |
feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8821 merge InferShape into master feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5250 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:Unknown Shape/ Unknown Rank迁移适配 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8821 | 11 天前 | |
feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8821 merge InferShape into master feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5250 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:Unknown Shape/ Unknown Rank迁移适配 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8821 | 11 天前 | |
feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Co-authored-by: xuejinghui<xuejinghui@huawei.com> # message auto-generated for no-merge-commit merge: !8821 merge InferShape into master feat: 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 Created-by: xuejinghui Commit-by: xuejinghui Merged-by: cann-robot Description: ## 描述 18个迁移算子适配unknown shape/rank InferShape并补UT及入口日志 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5250 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:Unknown Shape/ Unknown Rank迁移适配 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8821 | 11 天前 | |
sparseApply系列算子clean code整改 Co-authored-by: lixin433<lixin433@huawei.com> # message auto-generated for no-merge-commit merge: !10009 merge master into master sparseApply系列算子clean code整改 Created-by: lixin433 Commit-by: lixin433 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> sparseApply系列算子clean code整改 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000-->[#5659](https://gitcode.com/cann/ops-nn/issues/5659) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ut、st通过,冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!10009 | 5 天前 | |
sparseApply系列算子clean code整改 Co-authored-by: lixin433<lixin433@huawei.com> # message auto-generated for no-merge-commit merge: !10009 merge master into master sparseApply系列算子clean code整改 Created-by: lixin433 Commit-by: lixin433 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> sparseApply系列算子clean code整改 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000-->[#5659](https://gitcode.com/cann/ops-nn/issues/5659) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ut、st通过,冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!10009 | 5 天前 | |
sparseApply系列算子clean code整改 Co-authored-by: lixin433<lixin433@huawei.com> # message auto-generated for no-merge-commit merge: !10009 merge master into master sparseApply系列算子clean code整改 Created-by: lixin433 Commit-by: lixin433 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> sparseApply系列算子clean code整改 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000-->[#5659](https://gitcode.com/cann/ops-nn/issues/5659) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ut、st通过,冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!10009 | 5 天前 | |
Format update: Adjusted the license description format in all relevant files. Co-authored-by: jiangqi<jiangqi47@h-partners.com> # message auto-generated for no-merge-commit merge: !365 merge license5 into master Format update: Adjusted the license description format in all relevant files. Created-by: jiangqi2025 Commit-by: jiangqi Merged-by: turing_project1 Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #123--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!365 | 8 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 13 天前 | ||
| 15 天前 | ||
| 13 天前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 10 天前 | ||
| 8 天前 | ||
| 17 天前 | ||
| 13 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 3 天前 | ||
| 16 天前 | ||
| 1 个月前 | ||
| 15 天前 | ||
| 13 天前 | ||
| 15 天前 | ||
| 17 天前 | ||
| 4 天前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 3 天前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 10 天前 | ||
| 5 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 9 天前 | ||
| 20 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 10 天前 | ||
| 10 天前 | ||
| 4 天前 | ||
| 6 天前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 4 天前 | ||
| 10 天前 | ||
| 15 天前 | ||
| 1 个月前 | ||
| 3 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 4 天前 | ||
| 1 个月前 | ||
| 11 天前 | ||
| 11 天前 | ||
| 11 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 5 天前 | ||
| 8 个月前 |