| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
feat(sort): 小轴场景排序性能优化,新增3个kernel并优化已有策略 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !2843 merge master into master feat(sort): 小轴场景排序性能优化,新增3个kernel并优化已有策略 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 ### 背景 Sort 算子在排序轴长度较小(small axis)时,原有大核策略(radix sort / merge sort)存在并行度不足、资源利用率低的问题,导致小轴场景性能退化。 ### 主要变更 **新增 3 个 Kernel:** - **SortAxisOneCopy**:axis=1 快路径,直接 DataCopy 搬运,跳过排序流程 - **SortSmallAxisInsertion**:SIMT 256 线程并行插入排序,适合几十以内的小轴 - **SortSmallAxisTwoStage**:两阶段排序(radix → rank-inverse/二次排序),batch 级并发,适合几十到几百的中等轴 **已有 Kernel 优化:** - **MergeSort**:新增 Sort32 编译期优化(Sort32 API + Extract repeatTimes=1 硬件快速路径) - **MergeSortBigSize**:支持多行并行,新增每行独立 workspace 分区(rowIdx/rowDataOffset),blockIdx 替换为 rowCoreIdx - **RadixSortMoreCore**:排序后 8bit 值通过 Queue 传递,ScatterKeysGlobal 直接使用 sortedValueLocal,优化UB访问 - **RadixSortOneCore**:新增双缓冲支持(bufferNum 从 tiling 动态配置) **重命名 Kernel:** - SortMergeBigBatch → SortMergeIntraCore(体现 core 内 block merge 真实语义) **Tiling 路由重构:** - 新增 schId 5-8 及对应 tiling key selector(INSERTION / TWO_STAGE / AXIS_ONE_COPY) - schId 0 与 schId 8 合并路由,通过 isSort32SmallAxis 标志控制 Sort32 优化 - 增加 uint64 溢出保护,标准化 CeilDiv/CeilDivMul 为 Ops::Base 版本 - ONE_CORE_DATA_SIZE 从 1024 调整为 2048 - IsSortMergeMultiCore 扩展支持 unsortDimNum > 1 多行场景 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/1612 ## 测试 1. 新增117用例覆盖边界场景和性能采集,精度通过,性能达标 2. 原始155用例精度验证通过,性能提升或者持平 3. 二级冒烟通过 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!2843 | 4 个月前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
fix(sort): replace double-buffer magic number Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5866 merge master into master fix(sort): replace double-buffer magic number Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 增加 DOUBLE_BUFFER_NUM 具名常量,替换 Sort MergeSort 三个双缓冲队列模板参数中的魔数 2,不改变队列长度和算法行为。 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/3230 ## 测试 - 二级冒烟通过 - 使用仓内 CSV 和 golden 进行 TTK release 验证:Sort 35/35通过。 ## 文档更新 无。 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5866 | 12 天前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
feat(median): add Median/NanMedian and align NaN/signed-zero ordering Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5104 merge median into master feat(median): add Median/NanMedian and align NaN/signed-zero ordering Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增 Ascend 950 Median/NanMedian 算子,并复用 KthValue 的多调度选择框架,避免为中位数复制完整排序实现。 主要改动: - 新增 Median/NanMedian 的 OpDef、L0 API、InferShape、arch35 Tiling、AICore kernel、simplified key、golden、UT 和 TTK 用例。 - 支持 float16、float32、bfloat16、int8/16/32/64、uint8/16/32/64;values 保持输入 dtype,indices 为 int64,约简维保留为 1。 - 在 KthValue tiling data 中增加 STATIC、PROPAGATE_NAN、IGNORE_NAN 三种模式: - Median 对浮点 NaN 采用传播语义; - NanMedian 按非 NaN 数量动态计算 lower-median rank; - 整数输入沿用静态 k 快路径,不增加 NaN 扫描。 - 抽取统一 KthValue kernel dispatch,使 insertion、two-stage、merge、radix-select 和非末轴 small-axis 等 schedule 可由三个算子共享。 - 为多核动态 rank 路径补充对齐的 per-core count workspace,并保持原算法 workspace 布局。 - 完善 Sort/KthValue 公共逻辑中的 canonical NaN key、重复值与 signed-zero 稳定源顺序;同步补充 Sort、KthValue、TopKV2 golden 和回归用例。 详细设计、语义和约束见关联 Issue。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/2968 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Median/NanMedian/KthValue/Sort 累计677个ST用例通过 - 二级冒烟通过 - aclnnMedianDim,aclnnNanMedianDim 的门槛用例均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5104 | 1 个月前 | |
feat(median): add Median/NanMedian and align NaN/signed-zero ordering Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5104 merge median into master feat(median): add Median/NanMedian and align NaN/signed-zero ordering Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增 Ascend 950 Median/NanMedian 算子,并复用 KthValue 的多调度选择框架,避免为中位数复制完整排序实现。 主要改动: - 新增 Median/NanMedian 的 OpDef、L0 API、InferShape、arch35 Tiling、AICore kernel、simplified key、golden、UT 和 TTK 用例。 - 支持 float16、float32、bfloat16、int8/16/32/64、uint8/16/32/64;values 保持输入 dtype,indices 为 int64,约简维保留为 1。 - 在 KthValue tiling data 中增加 STATIC、PROPAGATE_NAN、IGNORE_NAN 三种模式: - Median 对浮点 NaN 采用传播语义; - NanMedian 按非 NaN 数量动态计算 lower-median rank; - 整数输入沿用静态 k 快路径,不增加 NaN 扫描。 - 抽取统一 KthValue kernel dispatch,使 insertion、two-stage、merge、radix-select 和非末轴 small-axis 等 schedule 可由三个算子共享。 - 为多核动态 rank 路径补充对齐的 per-core count workspace,并保持原算法 workspace 布局。 - 完善 Sort/KthValue 公共逻辑中的 canonical NaN key、重复值与 signed-zero 稳定源顺序;同步补充 Sort、KthValue、TopKV2 golden 和回归用例。 详细设计、语义和约束见关联 Issue。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/2968 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Median/NanMedian/KthValue/Sort 累计677个ST用例通过 - 二级冒烟通过 - aclnnMedianDim,aclnnNanMedianDim 的门槛用例均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5104 | 1 个月前 | |
feat(median): add Median/NanMedian and align NaN/signed-zero ordering Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5104 merge median into master feat(median): add Median/NanMedian and align NaN/signed-zero ordering Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 新增 Ascend 950 Median/NanMedian 算子,并复用 KthValue 的多调度选择框架,避免为中位数复制完整排序实现。 主要改动: - 新增 Median/NanMedian 的 OpDef、L0 API、InferShape、arch35 Tiling、AICore kernel、simplified key、golden、UT 和 TTK 用例。 - 支持 float16、float32、bfloat16、int8/16/32/64、uint8/16/32/64;values 保持输入 dtype,indices 为 int64,约简维保留为 1。 - 在 KthValue tiling data 中增加 STATIC、PROPAGATE_NAN、IGNORE_NAN 三种模式: - Median 对浮点 NaN 采用传播语义; - NanMedian 按非 NaN 数量动态计算 lower-median rank; - 整数输入沿用静态 k 快路径,不增加 NaN 扫描。 - 抽取统一 KthValue kernel dispatch,使 insertion、two-stage、merge、radix-select 和非末轴 small-axis 等 schedule 可由三个算子共享。 - 为多核动态 rank 路径补充对齐的 per-core count workspace,并保持原算法 workspace 布局。 - 完善 Sort/KthValue 公共逻辑中的 canonical NaN key、重复值与 signed-zero 稳定源顺序;同步补充 Sort、KthValue、TopKV2 golden 和回归用例。 详细设计、语义和约束见关联 Issue。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/2968 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Median/NanMedian/KthValue/Sort 累计677个ST用例通过 - 二级冒烟通过 - aclnnMedianDim,aclnnNanMedianDim 的门槛用例均通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5104 | 1 个月前 | |
perf(sort): improve UB utilization for non-last-axis small sorts Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5147 merge optimperf into master perf(sort): improve UB utilization for non-last-axis small sorts Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 本次改动继续优化 Ascend 950 Sort 非末轴小轴场景,降低 no-transpose 路径的 UB 峰值,并消除通用 two-stage 实现对连续末轴路径带来的额外分支开销。 主要改动: - Host tiling 按排序阶段与索引写回阶段分别计算 UB 峰值;当常规布局无法容纳更大的 inner chunk 时,通过 keyParams4 下发分阶段复用标志。 - Kernel 将输入、排序值、临时空间和输出索引组织到同一块共享 UB 中,固定保留 sortedIndex 尾部区域;values 写回完成后复用前缀空间构造并写回 indices。 - 在共享 UB 的 value/index 写回边界增加 V_MTE3、MTE3_V 事件同步,保证 MTE3 完成消费后再覆盖复用区域。 - 为连续末轴 two-stage Sort 增加专用 Process 热循环,非末轴场景继续复用通用批次映射逻辑。 改动仅涉及 arch35/Ascend 950 Sort 实现,不改变算子接口、支持的数据类型、输出语义及 binary 注册范围。 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/2882 ## 测试 - 二级冒烟通过 - Sort KthValue算子ST用例通过 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5147 | 1 个月前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 | |
perf(sort): 优化归并、非末轴排序及索引输出 Co-authored-by: ConanHuang<huangxiaobin1@huawei.com> # message auto-generated for no-merge-commit merge: !5672 merge master into master perf(sort): 优化归并、非末轴排序及索引输出 Created-by: ConanHuang Commit-by: ConanHuang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 优化 Sort 在多行归并、非末轴小轴及 UB 可容纳整行的大轴场景中的执行开销,保持稳定排序、升降序及 values/indices 语义。 - 引入公共 ping-pong 归并,减少阶段间回拷;在适用路径批量归并多行,并优化多核末轮归并。 - 按实际 UB 布局统一选择整行归并路径,优化非末轴批次规划、NDDMA 搬运与向量化索引输出。 - 对 RegBase 平台排序轴后全为单例维的输入,通过 Reshape 消除冗余转置;其他输入沿用原路径。 - 同步 TopKV2 依赖模板,补充 NaN、正负零、尾块及稳定索引看护。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-math/issues/3230 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> - Ascend950PR_9579 :Sort kernel 395 条、正负零逐位比较 18 条、Sort ACLNN 40 条、TopKV2 受影响用例 177 条,合计 **630 条精度全部通过**,Sort 同时比较 values 和 indices。 - 相对前一版已验证实现,设备耗时异常项复测后未确认稳定超过 5% 且超过 0.5 μs 的劣化 - 二级冒烟通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!5672 | 14 天前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 14 天前 | ||
| 14 天前 | ||
| 4 个月前 | ||
| 14 天前 | ||
| 12 天前 | ||
| 14 天前 | ||
| 14 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 14 天前 | ||
| 14 天前 |