| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
feat(zeros_like): 910b的zeros_like实现 Co-authored-by: zhaohujie<zhaohujie@huawei.com> # message auto-generated for no-merge-commit merge: !3073 merge zeros-like-pr-2 into master feat(zeros_like): 910b的zeros_like实现 Created-by: zhaohujie Commit-by: zhaohujie Merged-by: cann-robot Description: ## 描述 内建 conversion/zeros_like 当前仅注册 ascend950(arch35 DAG kernel),在 Atlas A2(Ascend910B / DAV_2201) 上缺少原生 AscendC AI Core kernel。本需求为开源仓 experimental/conversion 补齐 ZerosLike 的 Ascend910B 原生 AscendC kernel,对标 torch.zeros_like / tf.zeros_like:给定输入张量,输出 shape/dtype 与之相同、元素全为 0 的张量。 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/1692 ## 测试 - 三层 UT 全通过(含 rank0/8维/NaN·Inf 位/determinism 边界,op_kernel 经 tikicpulib 真实执行); - C++ ST 真实 910B3 NPU 全 0 bitwise(rtol=atol=0)8 dtype + 边界全通过,plog/msprof 证实命中本仓 kernel、无 561103; - ATK pyaclnn 与 torch.zeros_like 标杆对拍泛化用例全通过; - aclnn 调用示例真实 NPU 运行输出全 0; - msprof 性能对比内置 DSL(int64 ≈14.8× 速度提升,浮点近写带宽极限持平)。 | Config (4096²) | Custom (us) | Built-in DSL (us) | Speedup | Note | |---|---|---|---|---| | **int64** | **41.56** | **614.90** | **14.8×** | built-in does int64 via **vmod simulation** → vector/scalar-bound (write only 3.6%); ours splits 2×uint32 pure write | | fp32 | ~near BW limit | slightly faster | ~0.85–0.93× | both ~2.5–3.4 TB/s (device write limit) | | fp16 / bf16 | ~near BW limit | slightly faster (7–17%, ≤7us) | ~0.85–0.93× | both write-bound | | int8 | ~even | ~even | ~1.0× | | | fp32 [256] (tiny) | BD=32 | BD=1, lighter | 0.53× (~1.6us abs) | built-in lighter launch on tiny shapes | ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [x] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!3073 | 3 个月前 | |
新增masked_scale算子Ascend C实现 Co-authored-by: tieyutong<tieyutong@huawei.com> # message auto-generated for no-merge-commit merge: !3584 merge masked_scale_upload_20260626 into master 新增masked_scale算子Ascend C实现 Created-by: tieyutong Commit-by: tieyutong Merged-by: cann-robot Description: ## 描述 新增 experimental/math/masked_scale算子实现,包含算子定义、InferShape、Tiling、Ascend C Kernel、L0/op_api 侧实现及 UT 用例。 主要改动: - 新增 MaskedScale 算子目录及构建配置。 - 实现 self * mask * scale elementwise 计算。 - 支持 self/y dtype:FLOAT16、FLOAT、BFLOAT16。 - 支持 mask dtype:UINT8、INT8、FLOAT16、FLOAT。 - 增加 shape size 上限保护,避免 uint32_t tiling 字段静默截断;Kernel GM 偏移使用 64 位临时计算。 ## 关联的Issue https://gitcode.com/cann/ops-math/issues/2066 ## 测试 已完成以下验证: - UT: - op_host:8 个用例通过 - op_kernel:2 个用例通过 - op_api/op_graph/aicpu:目标构建通过,当前无对应测试用例 - CI/打包: - bash build.sh --pkg --experimental --soc=ascend910b --ops=masked_scale --vendor_name=custom_math -j4 通过 - 已生成 cann-ops-math-custom_math_linux-aarch64.run - 包内包含 masked_scale_apt.py、masked_scale_apt kernel 目录、masked_scale_apt.json、libcust_opapi.so 等产物 说明:当前暂无 MaskedScale 算子的 ATK 用例标杆,因此本次未执行 ATK 标杆对比验证。 ## 文档更新 更新 experimental/math/masked_scale/README.md: - 补充算子功能、支持产品、输入输出约束。 - 移除不符合实际发布方式的 aclnnMaskedScale 两段式接口说明。 ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!3584 | 2 个月前 | |
update license Co-authored-by: zhaozi3<zhaozi3@h-partners.com> # message auto-generated for no-merge-commit merge: !417 merge master into master update license Created-by: zhaozi3 Commit-by: zhaozi3 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-math!417 | 9 个月前 | |
[feat] Add aicpu op: ReduceSum Expand Reshape GreaterEqual Co-authored-by: FengHaozhan<fenghaozhan@huawei.com> # message auto-generated for no-merge-commit merge: !2829 merge Reshape-4-op into master [feat] Add aicpu op: ReduceSum Expand Reshape GreaterEqual Created-by: FengHaozhan Commit-by: FengHaozhan Merged-by: cann-robot Description: ## 描述 本次改动为 Reshape、Expand、GreaterEqual、ReduceSum 四个算子补充了 AICPU 实现及相关支撑,具体包含: - Reshape: 新增 AICPU kernel, host infershape, example, UT, README/CMake - Expand: 新增 AICPU kernel, example, UT, README/CMake - GreaterEqual: 新增 AICPU kernel, example, UT, README/CMake - 更新了 docs/zh/op_list.md 文档,明确了相关算子的 AICPU 支持状态。 - 完善了 CMake 构建脚本,确保新增算子正确接入编译体系。 ## 关联的Issue #1621 ## 测试 - [ ] 编译构建验证:建议执行全量编译确保无冲突。 - [ ] AICPU 单元测试:已包含四个算子的 UT,建议在目标环境执行验证。 - [ ] Graph Example 基本验证:建议通过提供的 example 脚本跑通基本推断流程。 - [ ] 接口注册/加载验证:确认算子在系统启动时正确注册到 AICPU 算子库。 ## 文档更新 README 与 docs/zh/op_list.md 已按要求更新。 ## 类型标签 - [x] ✨ 新特性 - [ ] 🐛 修复 - [x] 🧪 测试 - [x] 📦 构建/CI - [x] 📝 文档更新 - [ ] 🎨 代码风格 - [ ] ♻️ 重构 - [ ] ⚡ 性能优化 - [ ] 🔒 安全修复 - [ ] 🏷️ 标签属性维护 - [ ] 🏷️ 废弃 See merge request: cann/ops-math!2829 | 4 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 3 个月前 | ||
| 2 个月前 | ||
| 9 个月前 | ||
| 4 个月前 |