| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
feat(zeros_like): 910b的zeros_like实现 Co-authored-by: zhaohujie<zhaohujie@huawei.com> # message auto-generated for no-merge-commit merge: !3073 merge zeros-like-pr-2 into master feat(zeros_like): 910b的zeros_like实现 Created-by: zhaohujie Commit-by: zhaohujie Merged-by: cann-robot Description: ## 描述 内建 conversion/zeros_like 当前仅注册 ascend950(arch35 DAG kernel),在 Atlas A2(Ascend910B / DAV_2201) 上缺少原生 AscendC AI Core kernel。本需求为开源仓 experimental/conversion 补齐 ZerosLike 的 Ascend910B 原生 AscendC kernel,对标 torch.zeros_like / tf.zeros_like:给定输入张量,输出 shape/dtype 与之相同、元素全为 0 的张量。 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/1692 ## 测试 - 三层 UT 全通过(含 rank0/8维/NaN·Inf 位/determinism 边界,op_kernel 经 tikicpulib 真实执行); - C++ ST 真实 910B3 NPU 全 0 bitwise(rtol=atol=0)8 dtype + 边界全通过,plog/msprof 证实命中本仓 kernel、无 561103; - ATK pyaclnn 与 torch.zeros_like 标杆对拍泛化用例全通过; - aclnn 调用示例真实 NPU 运行输出全 0; - msprof 性能对比内置 DSL(int64 ≈14.8× 速度提升,浮点近写带宽极限持平)。 | Config (4096²) | Custom (us) | Built-in DSL (us) | Speedup | Note | |---|---|---|---|---| | **int64** | **41.56** | **614.90** | **14.8×** | built-in does int64 via **vmod simulation** → vector/scalar-bound (write only 3.6%); ours splits 2×uint32 pure write | | fp32 | ~near BW limit | slightly faster | ~0.85–0.93× | both ~2.5–3.4 TB/s (device write limit) | | fp16 / bf16 | ~near BW limit | slightly faster (7–17%, ≤7us) | ~0.85–0.93× | both write-bound | | int8 | ~even | ~even | ~1.0× | | | fp32 [256] (tiny) | BD=32 | BD=1, lighter | 0.53× (~1.6us abs) | built-in lighter launch on tiny shapes | ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [x] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!3073 | 3 个月前 | |
【社区任务】Add roll operator Co-authored-by: boxw987<boxw987@gmail.com> # message auto-generated for no-merge-commit merge: !3333 merge roll-submit-master into master 【社区任务】Add roll operator Created-by: boxw987 Commit-by: boxw987 Merged-by: cann-robot Description: ## 描述 本次提交补齐 Roll 算子的开源实现,面向 Atlas A2 训练系列产品提供 ACLNN 两阶段调用接口。 Roll 的目标是沿指定维度对输入张量执行循环位移;当 dims 为空时,语义等价于先对输入做逻辑展平,再执行一维 roll,最后恢复原始形状。 本次实现重点解决以下问题: 1. 正式支持范围内的语义对齐。 2. 单维、多维、最后一维、非最后一维等不同访存形态下的统一实现。 3. 在控制实现复杂度的前提下,保证正式支持范围内的性能收益。 当前版本支持范围如下: - 数据类型:uint8、int8、bfloat16、float16、float32、int32、uint32 - 数据格式:ND - 维度范围:0-D 到 8-D - 语义特性:负维度归一化、重复维度合并、dims 为空的 flatten roll 当前版本不支持: - bool - int64 - 非 ND 格式 实现上采用 Host 侧归一化与 Tiling、Kernel 侧多路径搬运的方案: mermaid flowchart TD A[ACLNN 接口] --> B[参数校验] B --> C[dims shifts 归一化] C --> D[重复维度合并] D --> E[生成 Tiling 信息] E --> F[Kernel 路径选择] F --> G[连续段 Copy] F --> H[按行 Roll] F --> I[按 Block Roll] F --> J[Segmented Fallback] 整体设计思路如下: 1. Host 侧负责参数校验、负维归一化、重复维度合并和切分信息生成。 2. dims 为空时退化为 flatten roll,避免继续走原始多维索引路径。 3. 单 active dim 与多 active dim 分开建模,分别提取更适合搬运的结构信息。 4. 最后一维滚动优先按行处理,非最后维滚动优先按 block 重排。 5. 保留 segmented fallback 作为通用正确性兜底路径。 Kernel 路径选择可概括为: mermaid flowchart TD A[Kernel Process] --> B{activeDimCount == 0?} B -->|Yes| C[Identity Copy] B -->|No| D{dimNum == 1?} D -->|Yes| E[Flatten Roll] D -->|No| F{single active dim?} F -->|Yes| G{activeDim == 0?} G -->|Yes| H[Leading Dim Roll] G -->|No| I{innerSize == 1 and last dim?} I -->|Yes| J[Last Dim Row Roll] I -->|No| K[Single Dim Block Roll] F -->|No| L{last active dim is final dim?} L -->|Yes| M[Multi-Dim Last-Dim Roll] L -->|No| N[Multi-Dim Non-Last Roll] N --> O[Segmented Fallback] 本次实现保留的优化主线不是单点 shape 特化,而是以下几类可复用策略: 1. 连续段优先 能转为连续段搬运的场景,优先使用连续 copy 或源端对齐 copy,减少逐元素处理。 2. 最后一维按行优化 围绕最后一维滚动构建按行搬运、按行拼接和行组处理路径,降低访存碎片。 3. 非最后维按 block 重排 对中间维或多维组合滚动,优先按 block 建模,减少重复索引计算。 4. 小宽度定向增强 对部分 BF16、小宽度最后维和部分 uint8 小块场景,调整切分与 patch 策略,但不引入写死单一 shape 的独立实现。 输入约束方面,当前版本要求: 1. 输入输出 dtype 一致。 2. 输入输出 shape 一致。 3. rank 不超过 8。 4. dims 为空时,shifts 长度必须为 1。 5. dims 非空时,shifts 与 dims 长度必须一致。 6. dims 的取值范围为 [-rank, rank)。 7. 0 维输入时,shifts 长度必须为 1,且 dims 为空。 ## 关联的Issue - https://gitcode.com/cann/ops-math/issues/1971 ## 测试 本次改动包含以下验证范围: 1. ACLNN 接口参数校验用例 2. Host 侧 InferShape / Tiling 用例 3. Kernel 路径基础功能用例 4. dims 为空、负维度、重复维度合并等关键语义场景 5. 正式支持 dtype 范围内的基础调用样例 验收目标包括: 1. 正式支持范围内功能结果正确。 2. 单维、多维、负维和重复维度归并场景行为正确。 3. 正式支持范围内的性能目标优于参考 TBE。 ## 文档更新 本次同步补充了算子说明文档、接口文档以及需求与设计说明。 ## 类型标签 - [ ] Bug修复 - [ ] 新特性 - [x] 性能优化 - [x] 文档更新 - [x] 其他,请描述:新增 Roll 算子实现与配套文档 See merge request: cann/ops-math!3333 | 3 个月前 | |
update license Co-authored-by: zhaozi3<zhaozi3@h-partners.com> # message auto-generated for no-merge-commit merge: !417 merge master into master update license Created-by: zhaozi3 Commit-by: zhaozi3 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!417 | 9 个月前 | |
[feat] Add aicpu op: ReduceSum Expand Reshape GreaterEqual Co-authored-by: FengHaozhan<fenghaozhan@huawei.com> # message auto-generated for no-merge-commit merge: !2829 merge Reshape-4-op into master [feat] Add aicpu op: ReduceSum Expand Reshape GreaterEqual Created-by: FengHaozhan Commit-by: FengHaozhan Merged-by: cann-robot Description: ## 描述 本次改动为 Reshape、Expand、GreaterEqual、ReduceSum 四个算子补充了 AICPU 实现及相关支撑,具体包含: - Reshape: 新增 AICPU kernel, host infershape, example, UT, README/CMake - Expand: 新增 AICPU kernel, example, UT, README/CMake - GreaterEqual: 新增 AICPU kernel, example, UT, README/CMake - 更新了 docs/zh/op_list.md 文档,明确了相关算子的 AICPU 支持状态。 - 完善了 CMake 构建脚本,确保新增算子正确接入编译体系。 ## 关联的Issue #1621 ## 测试 - [ ] 编译构建验证:建议执行全量编译确保无冲突。 - [ ] AICPU 单元测试:已包含四个算子的 UT,建议在目标环境执行验证。 - [ ] Graph Example 基本验证:建议通过提供的 example 脚本跑通基本推断流程。 - [ ] 接口注册/加载验证:确认算子在系统启动时正确注册到 AICPU 算子库。 ## 文档更新 README 与 docs/zh/op_list.md 已按要求更新。 ## 类型标签 - [x] ✨ 新特性 - [ ] 🐛 修复 - [x] 🧪 测试 - [x] 📦 构建/CI - [x] 📝 文档更新 - [ ] 🎨 代码风格 - [ ] ♻️ 重构 - [ ] ⚡ 性能优化 - [ ] 🔒 安全修复 - [ ] 🏷️ 标签属性维护 - [ ] 🏷️ 废弃 See merge request: cann/ops-math!2829 | 4 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 3 个月前 | ||
| 3 个月前 | ||
| 9 个月前 | ||
| 4 个月前 |