| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
AIDD扫描链接问题修改 Co-authored-by: y60124828<yanglou1@h-partners.com> # message auto-generated for no-merge-commit merge: !9611 merge master into master AIDD扫描链接问题修改 Created-by: yanglu-1 Commit-by: y60124828 Merged-by: cann-robot Description: ## 描述 AIDD扫描链接问题修改 ## 关联的Issue 例如:关联Issue #5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9611 | 8 天前 | |
修改测试问题 Co-authored-by: y60124828<yanglou1@h-partners.com> # message auto-generated for no-merge-commit merge: !7987 merge master into master 修改测试问题 Created-by: yanglu-1 Commit-by: y60124828 Merged-by: cann-robot Description: ## 描述 修改TorchNPU改名 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!7987 | 1 个月前 | |
Format update: Adjusted the license description format in all relevant files. Co-authored-by: jiangqi<jiangqi47@h-partners.com> # message auto-generated for no-merge-commit merge: !366 merge license6 into master Format update: Adjusted the license description format in all relevant files. Created-by: jiangqi2025 Commit-by: jiangqi Merged-by: turing_project1 Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #123--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!366 | 8 个月前 | |
将 experimental 下误用的 arch32 修正为 arch22 Co-authored-by: clinglai0517<laichangling@huawei.com> # message auto-generated for no-merge-commit merge: !8954 merge arch32-fix-pooling into master 将 experimental 下误用的 arch32 修正为 arch22 Created-by: clinglai0517 Commit-by: clinglai0517 Merged-by: cann-robot Description: ## 描述 将experimental目录下误用arch32的算子目录、文件名及代码引用统一修正为 arch22 ## 关联的Issue Issue #4931 ## 测试 本地ut通过 ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8954 | 19 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 12 天前 | |
【社区任务】huber_loss 前向算子补齐 reduction(none/mean/sum)支持 Co-authored-by: gcw_5x5Ew5Ms<yangzhengzekn0w@gmail.com> # message auto-generated for no-merge-commit merge: !9622 merge feature/huber_loss-reduction-support into master 【社区任务】huber_loss 前向算子补齐 reduction(none/mean/sum)支持 Created-by: gcw_5x5Ew5Ms Commit-by: gcw_5x5Ew5Ms Merged-by: cann-robot Description: 关联 issue:#5415 ## 改动内容 experimental/loss/huber_loss 原地升级,对齐 PyTorch aten::huber_loss 前向语义: 1. **新增 reduction 属性**:0=none / 1=mean(默认)/ 2=sum;mean/sum 输出 0 维标量。各核局部和写 workspace 用户区,SyncAll() 硬同步后 core0 汇总,mean 再除 totalDataNum。 2. **IR 参数名**:predictions / targets / loss 改为 input / target / output。 3. **非连续张量**:op_def 全部 AutoContiguous(),tiling 用 GetStorageShape()。 4. **dtype**:FLOAT / FLOAT16 / BFLOAT16,ND,任意维度;半精度在 Kernel 内升 FLOAT 计算,末端一次舍入回输出 dtype。 5. **边界语义**:delta > 0 校验(NaN 同拒);空张量 mean 得 NaN、sum 得 0;Inf/NaN 按 IEEE 传播。 新增两个文件:op_host/huber_loss_tiling_calc.h(tile 求解、核切分、workspace 估算抽为无框架依赖的纯函数)、op_kernel/huber_loss_tiling_key.h(tiling key 区分 none/reduce 两种调度,host 侧经 GET_TPL_TILING_KEY 发布)。 ## 接口变更(不兼容,请评审关注) 算子类型名保持 HuberLoss,但 IR 参数名变更且新增 reduction 属性;属性槽位序为 reduction=0、delta=1,host 与 kernel 均按位读取。 ## 验证(Atlas A2 + CANN 9.0.0,ascend910b) - build.sh -u --ophost --ops=huber_loss --experimental:InferShape / InferDataType / Tiling UT **32/32 PASSED**(含动态维度、空张量、shape/dtype/reduction/delta 非法输入、UB 不足、多核切分元素守恒) - build.sh -u --opkernel --ops=huber_loss --experimental:Kernel UT **3/3 PASSED**(两分支手算对拍、非默认 delta、非对齐尾段) - pre-commit 门禁(clang-format / codespell / OAT)全部通过 See merge request: cann/ops-nn!9622 | 5 天前 | |
图融合pass资料开源 Co-authored-by: zhangquanxin<zhangquanxin7@h-partners.com> # message auto-generated for no-merge-commit merge: !9725 merge fusion_pass_doc_open into master 图融合pass资料开源 Created-by: zhangquanxin Commit-by: zhangquanxin Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 该 PR 主要聚焦于图融合资料开源:将伪量化相关图融合 pass 的说明资料(文档)开放到仓库中。全部42 个文件的改动中,13均为纯新增(新增 278 行、删除 0 行),其余29个修改均为新增.gitattributes文件后图片文件附带提示的修改。本次改动以文档性内容的开放与补充为主,不涉及业务逻辑或接口变更。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> issue https://gitcode.com/cann/ops-nn/issues/5596 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> UT测试 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 无 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9725 | 2 天前 | |
docs: fix wrong op name LpNormV2 in lp_norm_v3 README Co-authored-by: liuhanwen8<liuhanwen8@huawei.com> # message auto-generated for no-merge-commit merge: !9920 merge fix/lp-norm-v3-readme-title into master docs: fix wrong op name LpNormV2 in lp_norm_v3 README Created-by: liuhanwen8 Commit-by: liuhanwen8 Merged-by: cann-robot Description: ## 描述 experimental/norm/lp_norm_v3/README.md 中的算子名称误写为 **LpNormV2**(共 5 处),实际算子为 **LpNormV3**: - 算子注册名为 LpNormV3:OP_ADD(LpNormV3)(op_host/lp_norm_v3_def.cpp:50) - aclnn 调用接口为 aclnnLpNormV3(examples/test_aclnn_lp_norm_v3.cpp:406) - 目录名、def/tiling/kernel 示例文件名均为 lp_norm_v3 该 README 疑似从 norm/lp_norm_v2 复制后未改名。本 PR 将标题及正文共 5 处 LpNormV2 全部更正为 LpNormV3,仅改文档,不涉及代码改动。 > 备注:原 PR #9919 因头分支重建被自动关闭后重开受限,本 PR 为其替代,内容与 #9919 最终状态完全一致(单提交)。 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue https://gitcode.com/cann/ops-nn/issues/5621 <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> ## 测试 仅文档改动,不涉及代码行为;已核对 master 分支 README 中 5 处错误位置,修正内容与算子实际注册名(LpNormV3)一致。 <!--描述进行了哪些测试来验证你的改动。--> ## 文档更新 更新了 experimental/norm/lp_norm_v3/README.md <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9920 | 1 天前 | |
md大模型检测低错修复 Co-authored-by: gitcode-chenjiao<chenjiao31@huawei.com> # message auto-generated for no-merge-commit merge: !9420 merge master into master md大模型检测低错修复 Created-by: gitcode-chenjiao Commit-by: gitcode-chenjiao Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> md aidd大模型检测低错修复 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/5254 ## 测试 <!--描述进行了哪些测试来验证你的改动。--> ok ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> acl*.md ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [x] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [ ] AI辅助编写 See merge request: cann/ops-nn!9420 | 12 天前 | |
feat: rename op_api_def.h to op_api_def_nn.h Co-authored-by: chenqianyu<chenqianyu1@h-partners.com> # message auto-generated for no-merge-commit merge: !8360 merge rename_opapidef into master feat: rename op_api_def.h to op_api_def_nn.h Created-by: FishPotatoChen Commit-by: chenqianyu Merged-by: cann-robot Description: ## 描述 本次改动将 op_api/op_api_def.h 重命名为 op_api/op_api_def_nn.h,并同步更新了所有引用该头文件的源文件与测试文件中的 #include 路径,共涉及 161 个文件。 改动原因:将 op_api 定义头文件统一命名为 op_api_def_nn.h,以更好地体现其所属模块(NN 算子)的语义,便于后续与其他模块的头文件区分管理。 此外,在提交过程中发现 4 个文件(aclnn_foreach_addcmul_scalar_v2.cpp、aclnn_max_unpool3d.cpp、test_aclnn_addmv.cpp、test_aclnn_fast_batchnorm_backward.cpp)的许可证头使用了非标准的旧格式,导致 OAT 合规检查失败。本次一并将其更新为标准的 CANN 开源许可证头格式,确保通过合规校验。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> https://gitcode.com/cann/ops-nn/issues/4954 ## 测试 - 通过 pre-commit 钩子校验:trailing whitespace、end-of-file-fixer、clang-format 均通过 - 通过 OAT 合规检查(161 个文件全部通过) - 本次为头文件重命名改动,不涉及逻辑变更,编译依赖关系保持不变 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> 无 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:头文件重命名与许可证头修复 ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!8360 | 19 天前 | |
Refactor turbo_quant_compress_latent to support DeepSeek-V4 Co-authored-by: wangbin207<wangbin207@huawei.com> Co-authored-by: root<qjgggsse@126.com> # message auto-generated for no-merge-commit merge: !9311 merge master into master Refactor turbo_quant_compress_latent to support DeepSeek-V4 Created-by: wangbin207 Commit-by: wangbin207;root Merged-by: cann-robot Description: # 描述 扩展 experimental/quant/turbo_quant_compress_latent/,为 Atlas A2(ascend910b)和 Atlas A3(ascend910_93)提供 DeepSeek-V4 TurboQuant 4bit KV latent 压缩能力。 本次改动保留 GLM 原有 output_mode=0 语义,新增 DeepSeek-V4 使用的 output_mode=1 compact corrected slot。 text norm_i = sqrt(sum_d latent[i][d]^2 + eps) u[i][d] = latent[i][d] / norm_i nibble[i][d] = argmin_c |u[i][d] - centroids[c]| slot[i][k] = nibble[i][2k] | (nibble[i][2k+1] << 4) mode 0 保持 320B 对齐布局,scale 为 float16(norm_i);mode 1 输出 258B compact corrected slot: text correctedScale_i = norm_i / sqrt(sum_d centroids[nibble[i][d]]^2 + eps) 当 headDim=512 时: | 模式 | 布局 | 大小 | | --- | --- | ---: | | mode 0 | 256B packed nibble + 2B norm + 62B padding | 320B | | mode 1 | 256B packed nibble + 2B corrected scale | 258B | ## 关联的Issue [扩展TurboQuant4bit算子以支持DeepSeek V4系列模型][(https://gitcode.com/cann/ops-nn/issues/4942) # 测试 测试环境:CANN 9.0.1;A2 使用 ascend910b package;当前空闲物理 die 8-15 对应逻辑设备 4-7,真机运行时为 ascend910_93,使用匹配的 A3 package 完成验证。 ## 构建 bash bash build.sh --pkg --soc=ascend910b --ops=turbo_quant_compress_latent --experimental --vendor_name=customize bash build.sh --pkg --soc=ascend910_93 --ops=turbo_quant_compress_latent --experimental --vendor_name=customize A2 package 构建通过,生成 .run 包、aclnn header、proto 和 kernel binary;A3 cross-build 通过。 ## UT | 套件 | 结果 | | --- | --- | | tests/ut/op_host | **22/22 PASS** | | tests/ut/op_kernel | **24/24 PASS** | Host 层覆盖默认 mode 0、显式 mode 1、动态 token/head 维、slot size、tiling 字段、空 Tensor、非法 headDim、非法 centroid 数、非法 mode 和非法 rank。 Kernel ICPU UT 覆盖 mode 0 回归、mode 1 多核切分、尾核、batch 尾块、最大 batch、空 Tensor、uniform、gauss_lat、全部 centroid offset、NaN/Inf 混合输入以及 258B 行间距。 摘要: text total=24, pass=24, fail=0, timeout=0 ## Golden 与精度判据 golden 脚本位于: text tests/ut/op_kernel/turbo_quant_compress_latent_data/ gen_data.py golden.py compare_data.py golden 按 kernel 运算顺序复刻 FP32 L2 reduce、归一化、中点边界计数、码本选择、corrected-scale 规约、FP16 cast 和 int4 pack。 本算子输出为 UINT8,有限输入采用逐字节比较:packed nibble 和 mode 1 corrected scale 的 FP16 bit pattern 必须一致,mode 0 padding 必须全零;非有限输入比较 IEEE 类别。 已生成 mode 1 shape 矩阵: text 0 1 2 3 4 8 12 16 20 24 28 40 41 64 127 128 512 1000 1024 2048 4096 4097 8192 16384 65536 ## 性能 本次已完成 mode 0/1 真机精度和大输入验证;尚未新增 profiler 性能数据,性能 profiling 不影响逐字节正确性结论。 mode 1 相比 mode 0 的额外计算来自 selected centroid 向量选择、centroid norm 规约和 corrected scale 计算。slot payload 从 320B 降至 258B,减少 DeepSeek-V4 KV cache padding;端到端收益需要与读取侧融合 Attention 一起评估。 ## 文档更新 - 更新 experimental/quant/turbo_quant_compress_latent/README.md; - 更新 docs/aclnnTurboQuantCompressLatent.md; - 更新 aclnn 调用示例; - 更新 PyTorch eager、Meta 和图模式说明; - 补充 mode 0/1 布局、corrected scale 语义和约束说明。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: ## AI/Agent生成声明 <!-- [x] 表示选中 --> - [x] AI辅助编写 See merge request: cann/ops-nn!9311 | 9 天前 | |
Format update: Adjusted the license description format in all relevant files. Co-authored-by: jiangqi<jiangqi47@h-partners.com> # message auto-generated for no-merge-commit merge: !366 merge license6 into master Format update: Adjusted the license description format in all relevant files. Created-by: jiangqi2025 Commit-by: jiangqi Merged-by: turing_project1 Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #123--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!366 | 8 个月前 | |
Format update: Adjusted the license description format in all relevant files. Co-authored-by: jiangqi<jiangqi47@h-partners.com> # message auto-generated for no-merge-commit merge: !366 merge license6 into master Format update: Adjusted the license description format in all relevant files. Created-by: jiangqi2025 Commit-by: jiangqi Merged-by: turing_project1 Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #123--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-nn!366 | 8 个月前 |