| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
A5 support MseLoss MaxPoolWithArgmaxV3 MaxPoolGradWithArgmaxV3 Co-authored-by: tangpingchuan<tangpingchuan@huawei.com> # message auto-generated for no-merge-commit merge: !533 merge open into master A5 support MseLoss MaxPoolWithArgmaxV3 MaxPoolGradWithArgmaxV3 Created-by: pingchuantang Commit-by: tangpingchuan Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!533 | 9 个月前 | |
部分pool、index算子 功能增强 Co-authored-by: 王世龙<wangshilong23@huawei.com> # message auto-generated for no-merge-commit merge: !1207 merge nnDeug into master 部分pool、index算子 功能增强 Created-by: wang-shilong32 Commit-by: 王世龙 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 重构代码,增强以下算子功能、修改相应文档,修改方案如下: embedding_bag:完善文档中支持芯片类型,芯片限制条件以及参数范围。 embedding_dense_grad_v2:完善算子文件结构,将opapi迁移至ophost同级目录,并修改对应cmake,同时修复msprof无法采集各l0接口信息的bug。 avg_pool3_d:修改芯片支持类型判定条件,完善ut、st用例。 avg_pool3_d_grad:修改芯片支持类型判定条件,完善st用例。 max_pool3_d:完善文档中支持芯片类型。 max_pool3d_grad_with_argmax:修改芯片支持类型判定条件,完善st用例。 max_pool_grad_with_argmax_v3:完善文档中支持芯片类型,添加算子依赖,修改芯片支持类型判定条件,完善st用例。 max_pool_v3:完善文档中支持芯片类型,完善ut用例。 max_pool_with_argmax_v3:完善文档中支持芯片类型,torch图模式支持三维场景,添加算子依赖,修改芯片支持类型判定条件,修复ut用例。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-nn/issues/650 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 更新embedding_bag、max_pool3_d、max_pool_grad_with_argmax_v3、max_pool_with_argmax_v3、max_pool_v3算子文档 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [x] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!1207 | 8 个月前 | |
[CANNBot]修复pooling融合规则平台限制,仅支持Ascend950 Co-authored-by: Apricityh<wangxu359@huawei.com> # message auto-generated for no-merge-commit merge: !4419 merge FusionPass_PlatformFix into master [CANNBot]修复pooling融合规则平台限制,仅支持Ascend950 Created-by: Apricityh Commit-by: Apricityh Merged-by: cann-robot Description: ## 描述 修复pooling融合规则平台限制,仅支持Ascend950 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/2434 ## 测试 修改后测试精度正常 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!4419 | 5 个月前 | |
fix: 注释错误 Co-authored-by: 丛吉钰<congjiyu@h-partners.com> # message auto-generated for no-merge-commit merge: !3216 merge master into master fix: 注释错误 Created-by: cong-jiyu Commit-by: 丛吉钰 Merged-by: cann-robot Description: ## 描述 更新了注释中opc,改为asc_opc ## 关联的Issue [#1716](https://gitcode.com/cann/ops-nn/issues/1716) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 更新了注释中opc,改为asc_opc ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!3216 | 6 个月前 | |
maxPoolGrad simd模板 Co-authored-by: liuchuangdev<liuchuang51@huawei.com> Co-authored-by: qq_52056150<wangshuo179@huawei.com> Co-authored-by: oah28<wujiahao37@huawei.com> # message auto-generated for no-merge-commit merge: !4252 merge max_pool_grad_merge into master maxPoolGrad simd模板 Created-by: liuchuangdev Commit-by: qq_52056150;oah28;liuchuangdev Merged-by: cann-robot Description: ## 描述 ## 一、功能概述 ### 1.1 背景 MaxPoolGrad算子是深度学习中常用的反向传播算子,用于计算池化操作的梯度。针对不同的kernel大小和输入shape,需要不同的计算策略以实现最优性能: - **小kernel场景**:需要高向量化利用率,批量处理减少循环开销 - **大kernel场景**:需要支持kernel分割,避免UB溢出 - **通用场景**:需要支持多种数据格式(NCHW/NHWC)和索引类型(int32/int64) 传统单模式实现难以兼顾所有场景的性能需求,因此设计了**SIMD多模式模板系统**。 ### 1.2 核心特性 本PR实现了完整的SIMD模板系统,包含以下核心特性: | 特性 | 描述 | 技术优势 | |------|------|---------| | **三种Kernel模式** | SmallKernel、BigKernel、SIMT | 自动适配不同场景,性能最优 | | **编译期模板选择** | ASCENDC_TPL机制 | 零运行时开销,编译期确定实现路径 | | **多数据格式支持** | NCHW/NHWC双格式 | 覆盖主流框架需求(PyTorch/TensorFlow) | | **多索引类型支持** | int32/int64双类型 | 兼容不同argmax精度需求 | | **边界检查控制** | IS_CHECK_RANGE开关 | 针对不同场景优化性能 | | **向量API优化** | MicroAPI批量处理 | 高向量化利用率,减少指令数 | ## 二、代码结构 ### 2.1 文件组织 pooling/max_pool_grad/ ├── op_kernel/ │ ├── max_pool_grad.cpp # 主Kernel模板入口 │ ├── arch35/ │ │ ├── max_pool_grad_struct.h # 模板参数定义(ASCENDC_TPL) │ │ ├── max_pool_grad_simt.h # SIMT模式实现 │ │ ├── max_pool_grad_nchw_small_kernel.h # SmallKernel模式实现 │ │ ├── max_pool_grad_nchw_big_kernel.h # BigKernel模式实现 │ │ ├── max_pool_grad_nchw_backward_base.h # Backward公共基类 │ │ └── max_pool_grad_simt.h # SIMT通用实现 │ └── pool_grad_common/ │ └── arch35/ │ ├── max_pool_grad_with_argmax_base_common.h # 公共函数(Gather/Scatter) │ └── max_pool_grad_nchw_scatter_common.h # Scatter处理实现 ├── op_host/ │ └── arch35/ │ ├── max_pool_grad_tiling.cpp # Tiling实现(选择Kernel模式) │ └── max_pool_grad_tiling_simt.cpp # SIMT专用Tiling ├── tests/ │ ├── ut/ │ │ └ op_host/ │ │ └── test_max_pool_grad_tiling.cpp # Tiling UT测试 │ └── st/ │ └── test_max_pool_grad_st.py # ST性能测试 └── docs/ ├── max_pool_grad_doc.md # 算子文档 └── max_pool_grad_simd_template_pr.md # 本PR文档 ### 2.2 关键类关系图 ┌────────────────────────────────────────────┐ │ max_pool_grad<模板参数> │ │ - KERNEL_MODE │ │ - FORMAT │ │ - INDICES_DTYPE │ │ - IS_CHECK_RANGE │ └────────────────────────────────────────────┘ ↓ if constexpr ┌───────────────┼───────────────┐ ↓ ↓ ↓ ┌─────────┐ ┌─────────┐ ┌─────────┐ │SmallKernel│ │BigKernel │ │ SIMT │ │ Mode │ │ Mode │ │ Mode │ └─────────┘ └─────────┘ └─────────┘ ↓ ↓ ↓ ┌─────────────────────────────────────────────┐ │ MaxPoolGradNCHWBackwardBase(公共基类) │ │ - BackwardCompute(Scatter处理) │ │ - CopyInGrad / CopyOut │ │ - ScalarCompute(Tiling计算) │ └─────────────────────────────────────────────┘ --- ## 关联的Issue [#2276](https://gitcode.com/cann/ops-nn/issues/2276) ## 测试 基本功能测试,通路测试,冒烟测试,改动算子门槛回归、门槛测试、性能测试 ## 文档更新 新增pooling/max_pool_grad/op_graph/max_pool_grad_proto.h包含接口brief ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!4252 | 5 个月前 | |
[CANNBot]修复pooling融合规则平台限制,仅支持Ascend950 Co-authored-by: Apricityh<wangxu359@huawei.com> # message auto-generated for no-merge-commit merge: !4419 merge FusionPass_PlatformFix into master [CANNBot]修复pooling融合规则平台限制,仅支持Ascend950 Created-by: Apricityh Commit-by: Apricityh Merged-by: cann-robot Description: ## 描述 修复pooling融合规则平台限制,仅支持Ascend950 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/2434 ## 测试 修改后测试精度正常 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!4419 | 5 个月前 | |
[CANNBot]新增pooling融合规则并迁移至新Pass框架 Co-authored-by: Apricityh<wangxu359@huawei.com> # message auto-generated for no-merge-commit merge: !2811 merge FusionPass into master [CANNBot]新增pooling融合规则并迁移至新Pass框架 Created-by: Apricityh Commit-by: Apricityh Merged-by: cann-robot Description: ## 描述 [CANNBot]新增pooling融合规则并迁移至新Pass框架 ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/2248 ## 测试 回归图转换成功且通路算子精度pass ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:pooling融合规则并迁移至新Pass框架 ## 改动说明 基于新Pass框架与ES接口重构并迁移以下融合规则: 1. MaxPoolFusionPass: MaxPool → MaxPoolV3 2. MaxPoolWithArgmaxV3FusionPass: V1/V2 → MaxPoolWithArgmaxV3 3. MaxPoolGradWithArgmaxV3FusionPass: V1/V2 → MaxPoolGradWithArgmaxV3 ## AI/Agent 生成声明 代码来源: - [ ] 纯人工手写 - [x] AI 辅助编写(思路/片段/优化) - [ ] AI 完全生成 人工审查:已完成 测试验证:已通过 合规检查:已完成 See merge request: cann/ops-nn!2811 | 5 个月前 | |
nn仓doc tools扫描内容修改 Co-authored-by: caiwenwen<caiwenwen6@h-partners.com> # message auto-generated for no-merge-commit merge: !3414 merge master into master nn仓doc tools扫描内容修改 Created-by: caiwenwen Commit-by: caiwenwen Merged-by: cann-robot Description: ## 描述 修改markdown语法和链接,1000个左右。 ## 关联的Issue 关联Issue [#1783](https://gitcode.com/cann/ops-nn/issues/1783) ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 更新了README.md、gitcode、cmake、common、control、conv、docs、examples、experimental、hash、index、loss、matmul、optim、pooling等文件。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!3414 | 6 个月前 |
MaxPoolWithArgmaxV3
产品支持情况
| 产品 | 是否支持 |
|---|---|
| Ascend 950PR/Ascend 950DT | √ |
| Atlas A3 训练系列产品/Atlas A3 推理系列产品 | × |
| Atlas A2 训练系列产品/Atlas A2 推理系列产品 | × |
| Atlas 200I/500 A2 推理产品 | × |
| Atlas 推理系列产品 | × |
| Atlas 训练系列产品 | × |
功能说明
- 算子功能:对于输入数据计算2维最大池化操作。
参数说明
| 参数名 | 输入/输出/属性 | 描述 | 数据类型 | 数据格式 |
|---|---|---|---|---|
| x | 输入 | 输入x | FLOAT16、BFLOAT16、FLOAT | ND |
| ksize | 输入属性 | 池化窗口大小 | Int | ND |
| strides | 输入属性 | 窗口移动步长 | Int | ND |
| pads | 输入属性 | 每一条边补充的层数 | Int | ND |
| dtype | 输入属性 | 输出argmax的数据类型 | Int | ND |
| dilation | 输入属性 | 控制窗口中元素步幅 | Int | ND |
| ceil_mode | 输入属性 | 为true是用向上取整的方法 | Bool | ND |
| data_format | 输入属性 | 数据格式 | String | ND |
| y | 输出 | 输出 | FLOAT16、BFLOAT16、FLOAT | ND |
| argmax | 输出 | 输出的损失tensor | INT32、INT64 | ND |
约束说明
无
调用说明
| 调用方式 | 样例代码 | 说明 |
|---|---|---|
| aclnn调用 | test_aclnn_max_pool_with_argmax_v3 | 通过aclnnMaxPool2dWithIndices接口方式调用MaxPoolWithArgmaxV3算子。 |