| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
产品名变更 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !5912 merge master into master 产品名变更 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> AI处理器对应的产品型号名称更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> [#3258](https://gitcode.com/cann/ops-math/issues/3258) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> *.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5912 | 9 天前 | |
Expand示例改用C++ RAII资源管理,与IsFinite/IsInf示例风格对齐 Co-authored-by: zhouqilong<zhouqilong2@huawei.com> # message auto-generated for no-merge-commit merge: !4682 merge raii-expand into master Expand示例改用C++ RAII资源管理,与IsFinite/IsInf示例风格对齐 Created-by: zhou-qilong Commit-by: zhouqilong Merged-by: cann-robot Description: ## 描述 将 math/expand/examples 下的 aclnn 示例由手动资源管理改为 C++ RAII 管理,与同仓 math/is_finite、math/is_inf 示例风格保持一致。 ## 测试 - bash build.sh --run_example expand eager --soc=ascend950:编译通过,在 Ascend950PR 上运行成功,示例正常退出。 ## 文档更新 无。 ## 类型标签 - [x] 其他,请描述:示例代码改造(C++ RAII资源管理) See merge request: cann/ops-math!4682 | 1 个月前 | |
refactor: 清理 math 算子日志文案与代码格式并移除 rfft1_d op_graph fallback Co-authored-by: esok11<yangsifa@huawei.com> # message auto-generated for no-merge-commit merge: !4794 merge f081702 into master refactor: 清理 math 算子日志文案与代码格式并移除 rfft1_d op_graph fallback Created-by: esok11 Commit-by: esok11 Merged-by: cann-robot Description: ## 描述 本次变更对 math 目录下多个算子(expand、histogram_fixed_width、tile、truncate_div、rfft1_d)的日志文案与代码格式进行清理,并移除 rfft1_d 的 op_graph fallback 插件;同时升级 opbase 依赖版本。除移除 rfft1_d fallback 与依赖升级外,其余改动均不改变算子的功能行为、Tiling 计算逻辑与数据搬运流程。 ### 改动原因 - 算子日志中存在拼写错误与语法不通顺语句,影响问题定位时日志的可读性: - truncate_div:Get ubSize form compileInfo / form ascendcPlatform 中 form 应为 from,且未带单位; - tile:after convertion 中 convertion 应为 conversion;less or equal 应为 less than or equal; - expand:greater or equal 应为 greater than or equal to;is not match 应为 does not match; - aclnn_repeat:but get %ld 应为 but got %ld; - histogram_fixed_width:调试日志中 Output_shape = 中的下划线与仓库其余 Output shape 风格不一致。 - tile 算子的 tile_tiling_arch35.cpp、tile_infershape.cpp 中部分函数使用 2 空格缩进、命名空间闭合注释为 } // namespace(双空格),与仓库主流 4 空格缩进、} // namespace(单空格)风格不一致;多个 OP_LOGE / OP_LOGE_FOR_INVALID_* 调用因参数换行排版混乱; - rfft1_d 的 op_graph fallback 插件(math/rfft1_d/op_graph/)不再需要保留,需整体移除; - opbase 依赖版本需同步升级至新 tag。 ### 改动方法 1. **日志文案修正**(涉及 5 个算子): - aclnn_expand.cpp:greater or equal to the number of dimensions → greater than or equal to the number of dimensions;is not match size → does not match size; - histogram_fixed_width_infershape.cpp:Output_shape = %s → Output shape = %s; - aclnn_repeat.cpp:but get %ld → but got %ld; - tile_tiling_arch35.cpp:after convertion → after conversion; - truncate_div_tiling_arch35.cpp:Get ubSize form compileInfo is: %ld → Get ubSize from compileInfo is: %ld B、Get ubSize form ascendcPlatform is: %ld → Get ubSize from ascendcPlatform is: %ld B(修正 form→from 并补充单位 B); - tile_infershape.cpp:less or equal than the input len → less than or equal to the input len。 2. **代码格式规整**(tile 算子两个文件为主): - tile_tiling_arch35.cpp:Tiling4Tile、TilingPrepare4Tile 函数体由 2 空格缩进改为 4 空格;多个 OP_LOGE_FOR_INVALID_SHAPEDIMS_WITH_REASON / OP_LOGE_FOR_INVALID_SHAPES_WITH_REASON / OP_LOGE_FOR_INVALID_VALUE_WITH_REASON 调用合并为单行或重排版;函数签名 Tiling4TileAscendC(...) 参数对齐调整;} // namespace optiling → } // namespace optiling;移除 Tiling4Tile 末尾多余空行; - tile_infershape.cpp:TileInferShapeCommon、InferShape4Tile 函数体由 2 空格缩进改为 4 空格;OP_CHECK_IF 与 OP_LOGE 换行重排版;} // namespace ops → } // namespace ops; - aclnn_expand.cpp、aclnn_repeat.cpp:OP_LOGE 多行参数重排版、aclnnExpandGetWorkspaceSize / aclnnRepeatGetWorkspaceSize 函数签名参数换行位置调整、CheckFormat 中 OP_LOGW 缩进修正。 3. **移除 rfft1_d op_graph fallback**: - 删除 math/rfft1_d/op_graph/CMakeLists.txt(18 行,原用于遍历子目录并注册 graph plugin 源); - 删除 math/rfft1_d/op_graph/rfft1_d_fallback.cpp(51 行,原实现 fallback::Rfft1DExecuteFunc,通过 CANN_OPS_OPB_SYN_EXEC_ACLNN(host_api_ctx, aclRfft1D, x_ge, n, dim, norm, output_ge) 调用 aclnn 接口的 fallback 执行路径)。 4. **依赖升级**: - cmake/third_party/opbase.cmake:OPBASE_TAG_ID 由 d807bccd922a62fe9cb576e0fcbe60dcdb13b288 升级至 0c5e25790f67e2c6f60c1df36d74d28f0e08ecfc。 涉及算子:Expand、HistogramFixedWidth、Tile(含 Repeat)、TruncateDiv、Rfft1D。日志与格式改动均位于 op_api 与 op_host 层;fallback 移除位于 op_graph 层;依赖升级位于 cmake 层。未触碰任何算子的 kernel 侧代码。 ## 关联的Issue - #2668 ## 测试 本次变更中日志与代码格式部分不改变算子计算逻辑与 Tiling 行为;rfft1_d fallback 移除需验证算子仍能通过原有非 fallback 路径正常执行。回归测试覆盖: - 二级冒烟:expand / histogram_fixed_width / tile / truncate_div / rfft1_d 各算子泛化用例; - 日志核查:构造非法输入(如 expand 的 size 维度小于 self 维度、tile multiples 长度超 8、repeats 负值等)触发错误日志,确认输出文本为新文案且语义正确; - rfft1_d 功能回归:验证移除 op_graph fallback 后 rfft1_d 算子在原支持的 shape / dtype 范围内执行结果与改动前一致; - tile tiling 回归:在 arch35 硬件上跑 tile / repeat 的 shape 泛化,确认 Tiling 结果与改动前一致。 ## 文档更新 无。本次变更不涉及对外接口与文档。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:代码清理(日志文案修正 + 代码格式规整)+ 移除 rfft1_d op_graph fallback + opbase 依赖升级 See merge request: cann/ops-math!4794 | 1 个月前 | |
新增Expand算子 Co-authored-by: l00939308<luwenxiang4@huawei.com> # message auto-generated for no-merge-commit merge: !1133 merge master into master 新增Expand算子 Created-by: luwenxiang1998 Commit-by: l00939308 Merged-by: cann-robot Description: ## 描述 新增Expand算子 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/814 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:新增Expand算子 See merge request: cann/ops-math!1133 | 6 个月前 | |
fix: pad_infershape 增加数据指针与 shape size 校验;expand/tile 以 static_cast 替换 reinterpret_cast Co-authored-by: Xbying<2119046648@qq.com> # message auto-generated for no-merge-commit merge: !5471 merge 11 into master fix: pad_infershape 增加数据指针与 shape size 校验;expand/tile 以 static_cast 替换 reinterpret_cast Created-by: 2301_81474000 Commit-by: Xbying Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 1. paddings_num 改用 int64_t 接收并校验 <= 0,通过后才 static_cast<size_t>;增加 paddings_value == nullptr 校验。 2. reinterpret_cast 替换为 static_cast 经 void* 中转。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3094 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5471 | 20 天前 | |
新增Expand算子 Co-authored-by: l00939308<luwenxiang4@huawei.com> # message auto-generated for no-merge-commit merge: !1133 merge master into master 新增Expand算子 Created-by: luwenxiang1998 Commit-by: l00939308 Merged-by: cann-robot Description: ## 描述 新增Expand算子 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/814 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:新增Expand算子 See merge request: cann/ops-math!1133 | 6 个月前 | |
[性能优化] 降低 Expand AICPU 广播临时内存 Co-authored-by: zhaowenrui666<zhaowenrui7@huawei.com> # message auto-generated for no-merge-commit merge: !5664 merge optimize-expand-aicpu-memory into master [性能优化] 降低 Expand AICPU 广播临时内存 Created-by: zhaowenrui666 Commit-by: zhaowenrui666 Merged-by: cann-robot Description: ## 描述 ### 优化目标 本 PR 只修改 math/expand/op_kernel_aicpu/expand_aicpu.cpp,降低 Expand AICPU kernel 在广播过程中的临时堆内存,同时保证功能语义和性能不劣化。 过程报告、内存统计器、专项 UT 和 microbench 仅用于本地验证,不进入提交。 ### 原实现问题 原实现先把输入 Tensor 完整复制到 input_values,再按广播轴循环调用 GetExpandIndex、CopyExpandIndex 和 CalculateOutIndex。每处理一个广播轴都会通过 vector::insert 物化中间结果,下一轮又将 output_values 复制回 input_values,最终再复制到输出 Tensor。 因此临时内存随 dtype 字节宽度和输出元素数增长。INT64 [1,34,34] -> [32,34,34] 场景中,输入为 1,156 个元素,kernel 额外申请达到 626,816 B。 原 dtype 分派还会在每次调用时构造 map<int, std::function<...>>,产生固定堆申请和间接调用。 ### 实现方案 1. 使用 ExpandPlan 保存规范化后的输入 Shape、目标 Shape、输入 stride 和外层坐标。 2. 从尾部合并输入输出维度相同的连续轴,形成尽可能大的连续复制块。 3. 广播维的输入坐标保持为 0,非广播维通过坐标进位增量更新输入偏移。 4. 从输入 Tensor 直接写入最终输出 Tensor,删除完整输入副本、逐层广播结果和最终输出副本。 5. dtype 分派改为 switch,去掉运行时 map<std::function>。 6. Shape 乘法增加溢出检查,并校验输出元素数不超过输出缓冲区容量。 7. 缓冲区容量和整数溢出只在复制循环外校验一次;FP16/BF16 单次复制小于 16 B 时使用 std::copy_n,达到 16 B 时使用 BiggerMemCpy,其它类型继续使用 std::copy_n,兼顾安全性和短拷贝性能。 对于 [1,34,34] -> [32,34,34],实现会将尾部 [34,34] 合并为 1,156 个元素的连续块,直接复制 32 次。输出数据只写一次,临时内存不再与输出元素数成正比。 ### 内存统计口径 只统计 kernel 执行窗口内 C++ new/new[] 的请求字节数和申请次数: text 内存优化率 = (优化前额外内存 - 优化后额外内存) / 优化前额外内存 * 100% - 输入、输出 Tensor 在统计窗口前创建,不计入额外内存; - 每个场景预热一次,只统计第二次 kernel; - 固定 128 KiB 校准精确增加 131,072 B 和 1 次申请; - 统计值不等同于 RSS、allocator 元数据或直接 malloc 的完整统计; - 基线为 bc6ffc697,优化提交为 3e68a14f0,前后环境和参数一致。 ### 全类型五档 Shape 结果 | 档位 | 输入 Shape | 输出 Shape | 输出元素数 | | --- | --- | --- | ---: | | S1 | [1,4,4] | [2,4,4] | 32 | | S2 | [1,16,16] | [8,16,16] | 2,048 | | S3 | [1,34,34] | [32,34,34] | 36,992 | | S4 | [1,64,64] | [64,64,64] | 262,144 | | S5 | [1,128,128] | [128,128,128] | 2,097,152 | 覆盖 BOOL/FLOAT16/BFLOAT16/FLOAT/INT8/UINT8/INT32/INT64 8 种类型,共 40 个场景。优化后全部固定为 1,504 B、61 次申请。 | dtype | S1 | S2 | S3 | S4 | S5 | S5 减少内存 | | --- | ---: | ---: | ---: | ---: | ---: | ---: | | BOOL | 31.8841% | 45.3488% | 87.4332% | 97.8119% | 99.7165% | 529,056 B | | FLOAT16 | 36.6470% | 86.8047% | 99.0502% | 99.8591% | 99.9822% | 8,454,822 B | | BFLOAT16 | 36.6470% | 86.8047% | 99.0502% | 99.8591% | 99.9822% | 8,454,822 B | | FLOAT | 41.3417% | 92.7033% | 99.5218% | 99.9295% | 99.9911% | 16,908,964 B | | INT8 | 34.0061% | 77.8530% | 98.1262% | 99.7187% | 99.9644% | 4,227,751 B | | UINT8 | 34.0061% | 77.8530% | 98.1262% | 99.7187% | 99.9644% | 4,227,751 B | | INT32 | 41.3417% | 92.7033% | 99.5218% | 99.9295% | 99.9911% | 16,908,964 B | | INT64 | 48.9130% | 96.1475% | 99.7601% | 99.9647% | 99.9956% | 33,817,248 B | 专项 INT64 [1,34,34] -> [32,34,34]: | 指标 | 优化前 | 优化后 | 变化 | | --- | ---: | ---: | ---: | | 额外申请字节 | 626,816 B | 1,504 B | 减少 625,312 B,99.76% | | 额外申请次数 | 93 | 61 | 减少 32 次,34.41% | | -O0 kernel 平均耗时 | 522,153 ns | 15,422 ns | 33.86x | | -O2 microbench | 98,582 ns | 4,256 ns | 23.16x | ### 全量 NPU 性能验证 - before/after 使用相同 HCC 7.3、-O2、NPU 和输入,按 ABBA 顺序交替执行。 - 覆盖 8 种 dtype、INT32/INT64 shape、rank 0~8、各类广播路径、1 KiB~256 MiB 输出,以及 FP16/BF16 单次复制 8B/16B/32B 的阈值边界,共 844 个性能点、21,096 条逐轮样本。 - 初筛 speedup 小于 0.98x 的 2 个 rank-0 小张量点追加 101 轮复测,最差结果为 1.015x,确认性能回退 0 个。 - 全部性能点 speedup 中位数为 3.119x;256 MiB 大 shape 提升 8.17x~54.85x。 - FP16 单次复制 8B/16B/32B 的 1 MiB 输出场景分别提升 1.40x、1.83x、3.07x,验证 16B 分界未引入性能劣化。 AICPU 通路使用独立 launcher,并在 ASCEND_GLOBAL_LOG_LEVEL=0 下找到 op type [Expand] run cpu kernel finished。64 MiB FP16 探针各采集 30 条,程序计时、AICPU 日志和 msprof --aicpu=on --task-time=l2 的中位数分别为 9,592.570 us、9,014.440 us、9,266.635 us,最大相对差 6.03%,确认实际进入 AICPU 且三种计时口径一致。 ### 功能与风险边界 - 支持的 8 种输入 dtype 和 2 种 shape dtype 保持不变; - 保持 -1 沿用输入维度、前导维补 1、标量、多轴广播和空 Tensor 语义; - 非法广播、目标 rank 小于输入 rank、负维度及乘法溢出返回参数错误; - Expand 为纯复制,不改变数值位模式; - 仍保留少量只与 rank 相关的 Shape vector,但不再申请与 Tensor 元素数相关的临时数据。 ## 关联的Issue - [ops-math #3254](https://gitcode.com/cann/ops-math/issues/3254) - 同步跟踪:[canndev #1901](https://gitcode.com/cann/canndev/issues/1901) ## 测试 - 仓库原有 Expand UT:8/8 通过; - 本地专项功能、边界、内存看护:4/4 通过; - 8 种 dtype × 5 档 Shape:40/40 通过; - 联合 ASAN:38/38 通过,未发现越界或释放错误; - microbench 在计时前通过 memcmp 确认新旧输出逐字节一致; - 分支切分后重新构建并运行仓库原有 AICPU UT:29/29 通过; - NPU 全量性能矩阵:844/844 完成,2 个可疑点完成 101 轮复测,确认回退 0 个; - AICPU 日志与 msprof 通路探针:30/30 条对应,三种计时中位数最大相对差 6.03%; - pre-commit run --from-ref ups/master --to-ref HEAD:全部通过,实际检查 1 个源码文件。 ## 文档更新 无。内存报告记录在 PR 描述中,不提交过程文档。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5664 | 10 天前 | |
[性能优化] 降低 Expand AICPU 广播临时内存 Co-authored-by: zhaowenrui666<zhaowenrui7@huawei.com> # message auto-generated for no-merge-commit merge: !5664 merge optimize-expand-aicpu-memory into master [性能优化] 降低 Expand AICPU 广播临时内存 Created-by: zhaowenrui666 Commit-by: zhaowenrui666 Merged-by: cann-robot Description: ## 描述 ### 优化目标 本 PR 只修改 math/expand/op_kernel_aicpu/expand_aicpu.cpp,降低 Expand AICPU kernel 在广播过程中的临时堆内存,同时保证功能语义和性能不劣化。 过程报告、内存统计器、专项 UT 和 microbench 仅用于本地验证,不进入提交。 ### 原实现问题 原实现先把输入 Tensor 完整复制到 input_values,再按广播轴循环调用 GetExpandIndex、CopyExpandIndex 和 CalculateOutIndex。每处理一个广播轴都会通过 vector::insert 物化中间结果,下一轮又将 output_values 复制回 input_values,最终再复制到输出 Tensor。 因此临时内存随 dtype 字节宽度和输出元素数增长。INT64 [1,34,34] -> [32,34,34] 场景中,输入为 1,156 个元素,kernel 额外申请达到 626,816 B。 原 dtype 分派还会在每次调用时构造 map<int, std::function<...>>,产生固定堆申请和间接调用。 ### 实现方案 1. 使用 ExpandPlan 保存规范化后的输入 Shape、目标 Shape、输入 stride 和外层坐标。 2. 从尾部合并输入输出维度相同的连续轴,形成尽可能大的连续复制块。 3. 广播维的输入坐标保持为 0,非广播维通过坐标进位增量更新输入偏移。 4. 从输入 Tensor 直接写入最终输出 Tensor,删除完整输入副本、逐层广播结果和最终输出副本。 5. dtype 分派改为 switch,去掉运行时 map<std::function>。 6. Shape 乘法增加溢出检查,并校验输出元素数不超过输出缓冲区容量。 7. 缓冲区容量和整数溢出只在复制循环外校验一次;FP16/BF16 单次复制小于 16 B 时使用 std::copy_n,达到 16 B 时使用 BiggerMemCpy,其它类型继续使用 std::copy_n,兼顾安全性和短拷贝性能。 对于 [1,34,34] -> [32,34,34],实现会将尾部 [34,34] 合并为 1,156 个元素的连续块,直接复制 32 次。输出数据只写一次,临时内存不再与输出元素数成正比。 ### 内存统计口径 只统计 kernel 执行窗口内 C++ new/new[] 的请求字节数和申请次数: text 内存优化率 = (优化前额外内存 - 优化后额外内存) / 优化前额外内存 * 100% - 输入、输出 Tensor 在统计窗口前创建,不计入额外内存; - 每个场景预热一次,只统计第二次 kernel; - 固定 128 KiB 校准精确增加 131,072 B 和 1 次申请; - 统计值不等同于 RSS、allocator 元数据或直接 malloc 的完整统计; - 基线为 bc6ffc697,优化提交为 3e68a14f0,前后环境和参数一致。 ### 全类型五档 Shape 结果 | 档位 | 输入 Shape | 输出 Shape | 输出元素数 | | --- | --- | --- | ---: | | S1 | [1,4,4] | [2,4,4] | 32 | | S2 | [1,16,16] | [8,16,16] | 2,048 | | S3 | [1,34,34] | [32,34,34] | 36,992 | | S4 | [1,64,64] | [64,64,64] | 262,144 | | S5 | [1,128,128] | [128,128,128] | 2,097,152 | 覆盖 BOOL/FLOAT16/BFLOAT16/FLOAT/INT8/UINT8/INT32/INT64 8 种类型,共 40 个场景。优化后全部固定为 1,504 B、61 次申请。 | dtype | S1 | S2 | S3 | S4 | S5 | S5 减少内存 | | --- | ---: | ---: | ---: | ---: | ---: | ---: | | BOOL | 31.8841% | 45.3488% | 87.4332% | 97.8119% | 99.7165% | 529,056 B | | FLOAT16 | 36.6470% | 86.8047% | 99.0502% | 99.8591% | 99.9822% | 8,454,822 B | | BFLOAT16 | 36.6470% | 86.8047% | 99.0502% | 99.8591% | 99.9822% | 8,454,822 B | | FLOAT | 41.3417% | 92.7033% | 99.5218% | 99.9295% | 99.9911% | 16,908,964 B | | INT8 | 34.0061% | 77.8530% | 98.1262% | 99.7187% | 99.9644% | 4,227,751 B | | UINT8 | 34.0061% | 77.8530% | 98.1262% | 99.7187% | 99.9644% | 4,227,751 B | | INT32 | 41.3417% | 92.7033% | 99.5218% | 99.9295% | 99.9911% | 16,908,964 B | | INT64 | 48.9130% | 96.1475% | 99.7601% | 99.9647% | 99.9956% | 33,817,248 B | 专项 INT64 [1,34,34] -> [32,34,34]: | 指标 | 优化前 | 优化后 | 变化 | | --- | ---: | ---: | ---: | | 额外申请字节 | 626,816 B | 1,504 B | 减少 625,312 B,99.76% | | 额外申请次数 | 93 | 61 | 减少 32 次,34.41% | | -O0 kernel 平均耗时 | 522,153 ns | 15,422 ns | 33.86x | | -O2 microbench | 98,582 ns | 4,256 ns | 23.16x | ### 全量 NPU 性能验证 - before/after 使用相同 HCC 7.3、-O2、NPU 和输入,按 ABBA 顺序交替执行。 - 覆盖 8 种 dtype、INT32/INT64 shape、rank 0~8、各类广播路径、1 KiB~256 MiB 输出,以及 FP16/BF16 单次复制 8B/16B/32B 的阈值边界,共 844 个性能点、21,096 条逐轮样本。 - 初筛 speedup 小于 0.98x 的 2 个 rank-0 小张量点追加 101 轮复测,最差结果为 1.015x,确认性能回退 0 个。 - 全部性能点 speedup 中位数为 3.119x;256 MiB 大 shape 提升 8.17x~54.85x。 - FP16 单次复制 8B/16B/32B 的 1 MiB 输出场景分别提升 1.40x、1.83x、3.07x,验证 16B 分界未引入性能劣化。 AICPU 通路使用独立 launcher,并在 ASCEND_GLOBAL_LOG_LEVEL=0 下找到 op type [Expand] run cpu kernel finished。64 MiB FP16 探针各采集 30 条,程序计时、AICPU 日志和 msprof --aicpu=on --task-time=l2 的中位数分别为 9,592.570 us、9,014.440 us、9,266.635 us,最大相对差 6.03%,确认实际进入 AICPU 且三种计时口径一致。 ### 功能与风险边界 - 支持的 8 种输入 dtype 和 2 种 shape dtype 保持不变; - 保持 -1 沿用输入维度、前导维补 1、标量、多轴广播和空 Tensor 语义; - 非法广播、目标 rank 小于输入 rank、负维度及乘法溢出返回参数错误; - Expand 为纯复制,不改变数值位模式; - 仍保留少量只与 rank 相关的 Shape vector,但不再申请与 Tensor 元素数相关的临时数据。 ## 关联的Issue - [ops-math #3254](https://gitcode.com/cann/ops-math/issues/3254) - 同步跟踪:[canndev #1901](https://gitcode.com/cann/canndev/issues/1901) ## 测试 - 仓库原有 Expand UT:8/8 通过; - 本地专项功能、边界、内存看护:4/4 通过; - 8 种 dtype × 5 档 Shape:40/40 通过; - 联合 ASAN:38/38 通过,未发现越界或释放错误; - microbench 在计时前通过 memcmp 确认新旧输出逐字节一致; - 分支切分后重新构建并运行仓库原有 AICPU UT:29/29 通过; - NPU 全量性能矩阵:844/844 完成,2 个可疑点完成 101 轮复测,确认回退 0 个; - AICPU 日志与 msprof 通路探针:30/30 条对应,三种计时中位数最大相对差 6.03%; - pre-commit run --from-ref ups/master --to-ref HEAD:全部通过,实际检查 1 个源码文件。 ## 文档更新 无。内存报告记录在 PR 描述中,不提交过程文档。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5664 | 10 天前 | |
ascend350 arch Co-authored-by: esok11<yangsifa@huawei.com> # message auto-generated for no-merge-commit merge: !5437 merge f0908 into master ascend350 arch Created-by: esok11 Commit-by: esok11 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5437 | 21 天前 | |
产品名变更 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !5912 merge master into master 产品名变更 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> AI处理器对应的产品型号名称更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> [#3258](https://gitcode.com/cann/ops-math/issues/3258) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> *.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5912 | 9 天前 |
Expand
产品支持情况
| 产品 | 是否支持 |
|---|---|
| Ascend 950PR&950DT系列产品 | √ |
| Atlas A3系列产品 | √ |
| Atlas A2系列产品 | √ |
| Atlas 200I/500 A2推理产品 | × |
| Atlas推理系列产品 | √ |
| Atlas训练系列产品 | √ |
功能说明
- 算子功能:将输入tensor广播到指定的shape。如输入tensor的shape为(1, 4),指定的shape为(2, 4),则输出是shape为(2, 4)的tensor。
参数说明
| 参数名 | 输入/输出/属性 | 描述 | 数据类型 | 数据格式 |
|---|---|---|---|---|
| x | 输入张量 | 需要被广播的张量。 | FLOAT16、FLOAT、INT32、INT64、INT8、UINT8、BOOL、BF16 | ND |
| shape | 输入张量 | 表示x广播后的shape大小。 | INT64、INT32 | - |
| y | 输出 | 维度最大不超过8维,shape由shape输入决定,dtype需要与self一致。 | 同x | ND |
约束说明
无
调用说明
| 调用方式 | 样例代码 | 说明 |
|---|---|---|
| 图模式调用 | test_geir_expand | 通过GE IR图模式调用Expand算子 |
| aclnn接口 | test_aclnn_expand | 通过aclnnExpand接口方式调用Expand算子。 |