文件最后提交记录最后更新时间
MatmulReduceScatterV2 切换AICPU通信引擎 Co-authored-by: andingfangt<miaominghao@huawei.com> # message auto-generated for no-merge-commit merge: !5002 merge master into master MatmulReduceScatterV2 切换AICPU通信引擎 Created-by: andingfangt Commit-by: andingfangt Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/2423 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: # Ascend C 代码检视报告 **检视对象**:ops-transformer_AICPU eb6bffd57 — MatmulReduceScatterV2 支持环境变量切换 CCU/AICPU 通信引擎 (V2版本) **检视时间**:2026-05-13 **检视技能**:ascendc-code-review(假设检验驱动) **适用规范**:cpp-secure.mdascendc-topk.mdascendc-api.md **变更规模**:12 files, +175 / -96 --- ## 一、检视范围 | 层级 | 文件 | 变更 | |------|------|------| | API | op_api/aclnn_matmul_reduce_scatter_v2.cpp | +37 | | Graph | op_graph/matmul_reduce_scatter_v2_gen_task.cpp | +27 | | Tiling | arch35/matmul_reduce_scatter_v2_tiling.cpp | +7 | | Tiling | arch35/quant_bmm_reduce_scatter_tiling.cpp | +10 | | Tiling | matmul_reduce_scatter_tiling_base.cpp | +4 | | Kernel | arch35/matmul_a2a_vec_reduce_fp16_bf16.h | +27 (含删 PRINTF) | | Kernel | arch35/matmul_reduce_scatter_fp16_bf16.h | +49 (含删 PRINTF) | | Kernel | arch35/quant_bmm_a2a_vec_reduce_fp8_hif8.h | +27 (含删 PRINTF) | | Kernel | arch35/quant_bmm_reduce_scatter_fp8_hif8.h | +25 (含删 PRINTF) | | 公共 | op_kernel/common_def.h | +14 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt.cpp | +32 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt_tiling_key.h | +12 | --- ## 二、假设检验过程 ### 代码段 1: mc2_comm_utils.hGetCommModeFromEnv()(Host 侧) **代码**(:27-34): ```cpp inline uint8_t GetCommModeFromEnv() { auto commModeEnv = getenv(COMM_MODE_ENV); if (commModeEnv != nullptr) { return COMM_MODE_AICPU; } return COMM_MODE_CCU; } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:getenv() 返回 char*,已判空 ✓ | 0% | | | 红线#5 变量初始化:commModeEnvgetenv() 赋值 ✓ | 0% | | | 4.1 外部输入校验:环境变量已判空 ✓ | 0% | | | TOPK-1 校验返回值:已校验 ✓ | 0% | | | 无除法、无数组访问、无动态内存 | — | **自信值:0%** → **✅ PASS** --- ### 代码段 2: aclnn_matmul_reduce_scatter_v2.cppSetNnopbaseHcclServerTypeByArch()(Host 侧) **代码**(:87-93): ```cpp static void SetNnopbaseHcclServerTypeByArch(aclOpExecutor *executor) { if ((executor == nullptr) || (NnopbaseSetHcclServerType == nullptr)) { return; } if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_2201) { NnopbaseSetHcclServerType(executor, NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_MTE); } else if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_3510) { uint8_t commMode = Mc2Comm::GetCommModeFromEnv(); NnopbaseHcclServerType serverType = (commMode == Mc2Comm::COMM_MODE_AICPU) ? NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_AICPU : NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_CCU; OP_LOGD("[COMM_MODE] Set HcclServerType to %s for DAV_3510.", (commMode == Mc2Comm::COMM_MODE_AICPU) ? "AICPU" : "CCU"); NnopbaseSetHcclServerType(executor, serverType); } } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:executor 判空 ✓、NnopbaseSetHcclServerType 函数指针判空 ✓ | 0% | | | 红线#5 变量初始化:commMode 函数调用赋值 ✓、serverType 三元表达式赋值 ✓ | 0% | | | 11.1 LOG API 空指针:%s 参数为字符串字面量(非 nullptr) ✓ | 0% | | | 11.2 参数数量:1个%s + 1个参数 ✓ | 0% | | | 11.3 类型匹配:%s 匹配 const char* ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 3: aclnn_matmul_reduce_scatter_v2.cpp — 调用侧判空(Host 侧) **代码**(:357-359): ```cpp if ((executor != nullptr) && (*executor != nullptr)) { SetNnopbaseHcclServerTypeByArch(*executor); } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:双重指针 executor*executor 都判空 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 4: common_def.hHcclTypeSelector(Kernel 侧) **代码**(:597-604): ```cpp constexpr int CCU_COMM_MODE = 0; constexpr int AICPU_COMM_MODE = 1; template <int commMode> struct HcclTypeSelector { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_CCU>; }; template <> struct HcclTypeSelector<AICPU_COMM_MODE> { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_AICPU>; }; ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 编译期纯类型计算,无运行时行为 ✓ | 0% | | | API-7(动态内存):无动态分配 ✓ | 0% | | | API-2(std::):未使用 std:: ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 5: 4 个 Kernel Header — HCCL V1→V2 升级 + PRINTF 清理(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:334-337 为例): ```cpp const void* hcclInitTilingV2 = &(tilingData_->mc2InitTiling); uint64_t hcclCcTilingOffset = offsetof(Mc2Tiling::MatmulReduceScatterV2TilingData, mc2CcTiling); hccl_.InitV2(contextGM, hcclInitTilingV2); hccl_.SetCcTilingV2(hcclCcTilingOffset); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#5 变量初始化:hcclInitTilingV2hcclCcTilingOffset 声明即初始化 ✓ | 0% | | | TOPK-3 局部变量指针生命周期:hcclInitTilingV2 指向 tilingData_ 成员(GM 指针),函数内有效 ✓ | 0% | | | 3.4 sizeof 指针:offsetof 作用于类型名,非指针,用法正确 ✓ | 0% | | | PRINTF 删除:纯清理,无安全影响 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 6: 4 个 Kernel Header — .template 关键字(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:398-400 为例): ```cpp handles_[i + shift] = hccl_.template ReduceScatter<true>( cWork, recvBuffer, recvCount, dataType_, HcclReduceOp::HCCL_REDUCE_SUM, stride, repeat); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | C++ 标准要求:hccl_ 类型为 typename HcclTypeSelector<TPL_COMM_MODE>::type(依赖类型),模板成员函数必须加 template 关键字,不加则编译失败 ✓ | 0% | | | 2.1 运算溢出:i + shift 为循环索引 + 常量偏移,来自模板参数范围 ✓ | 0% | | | 3.3 数组索引:handles_[i + shift] 在循环内(for i = 0; i < MAX_HANDLE),边界由循环保证 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 7: Tiling + Graph 层 — LOG API 安全(Host 侧) **OP_LOGD 调用**(以 matmul_reduce_scatter_v2_tiling.cpp:150-152 为例): ```cpp OP_LOGD(opName_, "[COMM_MODE] Set CommEngine to %d (AICPU=%d, CCU=default) for matmul_reduce_scatter_v2.", commMode, Mc2Comm::ENGINE_AICPU); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 11.2 参数数量:2个 %d + 2个参数 ✓ | 0% | | | 11.3 类型匹配:%d 匹配 uint8_t(变参提升为 int,值范围 0~2 安全) ✓ | 0% | | | 11.1 空指针:opName_ 为类成员,无 %s 解引用风险 ✓ | 0% | **自信值:0%** → **✅ PASS** > 同类 LOG 调用共 8 处,全部通过 11.1/11.2/11.3 检查。 --- ## 三、风险点清单 **本次检视未发现安全风险。** | 代码段 | 检查项 | 判定 | |--------|--------|------| | GetCommModeFromEnv() | 红线#4/#5、4.1、TOPK-1 | ✅ PASS | | SetNnopbaseHcclServerTypeByArch() | 红线#4/#5、3.5、11.1/11.2/11.3 | ✅ PASS | | 调用侧判空 | 红线#4 双重指针 | ✅ PASS | | HcclTypeSelector | API-2/API-7 | ✅ PASS | | HCCL V2 升级 + PRINTF 清理 | 红线#5、TOPK-3、3.4 | ✅ PASS | | .template 关键字 | C++ 标准合规、3.3 数组边界 | ✅ PASS | | LOG API(8处) | 11.1/11.2/11.3 | ✅ PASS | --- ## 四、红线问题 CheckList | 红线 | 检查结果 | |------|---------| | 1. 除法/求余除零保护 | 无除法/求余操作 | | 2. 数组越界保护 | handles_[] 访问在循环边界内 | | 3. 溢出/下溢保护 | 参与运算的量均为小范围 uint8_t/uint32_t | | 4. 指针保护 | 所有指针使用前已判空 ✓ | | 5. 变量初始化 | 全部声明即初始化 ✓ | | 6. 资源申请/释放匹配 | 无动态资源申请 | --- ## 五、存疑项(非安全问题,供参考) ### 存疑 1:HcclTypeSelector 默认模板静默兜底 - **位置**:op_kernel/common_def.h:597-600 - **描述**:非 AICPU_COMM_MODE(=1) 的任何值都静默回退 CCU,不触发编译错误 - **规范参考**:TOPK-7(输入校验精神,编译期场景无运行时影响) - **建议**: ```cpp // 仅允许已知值,非法值触发编译错误 template <int commMode> struct HcclTypeSelector; // 不定义 template <> struct HcclTypeSelector<0> { using type = ...CCU; }; template <> struct HcclTypeSelector<1> { using type = ...AICPU; }; ``` ### 存疑 2:SetNnopbaseHcclServerTypeByArch 缺少未知架构处理 - **位置**:aclnn_matmul_reduce_scatter_v2.cpp:87-93 - **描述**:仅处理 DAV\_2201 / DAV\_3510,其他架构静默跳过(函数直接 return) - **建议**:添加 else 分支记录 WARNING 日志或断言 --- ## 六、总结 | 维度 | 评价 | |------|------| | 安全性 | ✅ 无安全红线违反 | | API 合规 | ✅ HCCL V2 用法正确,.template 关键字符合 C++ 标准 | | LOG 安全 | ✅ 8 处 OP_LOGD 参数数量/类型匹配 | | 可维护性 | 📝 2 项存疑(非阻塞,不影响合入) | **最终判定:PASS** ✅ See merge request: cann/ops-transformer!500219 天前
MatmulReduceScatterV2 切换AICPU通信引擎 Co-authored-by: andingfangt<miaominghao@huawei.com> # message auto-generated for no-merge-commit merge: !5002 merge master into master MatmulReduceScatterV2 切换AICPU通信引擎 Created-by: andingfangt Commit-by: andingfangt Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/2423 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: # Ascend C 代码检视报告 **检视对象**:ops-transformer_AICPU eb6bffd57 — MatmulReduceScatterV2 支持环境变量切换 CCU/AICPU 通信引擎 (V2版本) **检视时间**:2026-05-13 **检视技能**:ascendc-code-review(假设检验驱动) **适用规范**:cpp-secure.mdascendc-topk.mdascendc-api.md **变更规模**:12 files, +175 / -96 --- ## 一、检视范围 | 层级 | 文件 | 变更 | |------|------|------| | API | op_api/aclnn_matmul_reduce_scatter_v2.cpp | +37 | | Graph | op_graph/matmul_reduce_scatter_v2_gen_task.cpp | +27 | | Tiling | arch35/matmul_reduce_scatter_v2_tiling.cpp | +7 | | Tiling | arch35/quant_bmm_reduce_scatter_tiling.cpp | +10 | | Tiling | matmul_reduce_scatter_tiling_base.cpp | +4 | | Kernel | arch35/matmul_a2a_vec_reduce_fp16_bf16.h | +27 (含删 PRINTF) | | Kernel | arch35/matmul_reduce_scatter_fp16_bf16.h | +49 (含删 PRINTF) | | Kernel | arch35/quant_bmm_a2a_vec_reduce_fp8_hif8.h | +27 (含删 PRINTF) | | Kernel | arch35/quant_bmm_reduce_scatter_fp8_hif8.h | +25 (含删 PRINTF) | | 公共 | op_kernel/common_def.h | +14 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt.cpp | +32 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt_tiling_key.h | +12 | --- ## 二、假设检验过程 ### 代码段 1: mc2_comm_utils.hGetCommModeFromEnv()(Host 侧) **代码**(:27-34): ```cpp inline uint8_t GetCommModeFromEnv() { auto commModeEnv = getenv(COMM_MODE_ENV); if (commModeEnv != nullptr) { return COMM_MODE_AICPU; } return COMM_MODE_CCU; } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:getenv() 返回 char*,已判空 ✓ | 0% | | | 红线#5 变量初始化:commModeEnvgetenv() 赋值 ✓ | 0% | | | 4.1 外部输入校验:环境变量已判空 ✓ | 0% | | | TOPK-1 校验返回值:已校验 ✓ | 0% | | | 无除法、无数组访问、无动态内存 | — | **自信值:0%** → **✅ PASS** --- ### 代码段 2: aclnn_matmul_reduce_scatter_v2.cppSetNnopbaseHcclServerTypeByArch()(Host 侧) **代码**(:87-93): ```cpp static void SetNnopbaseHcclServerTypeByArch(aclOpExecutor *executor) { if ((executor == nullptr) || (NnopbaseSetHcclServerType == nullptr)) { return; } if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_2201) { NnopbaseSetHcclServerType(executor, NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_MTE); } else if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_3510) { uint8_t commMode = Mc2Comm::GetCommModeFromEnv(); NnopbaseHcclServerType serverType = (commMode == Mc2Comm::COMM_MODE_AICPU) ? NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_AICPU : NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_CCU; OP_LOGD("[COMM_MODE] Set HcclServerType to %s for DAV_3510.", (commMode == Mc2Comm::COMM_MODE_AICPU) ? "AICPU" : "CCU"); NnopbaseSetHcclServerType(executor, serverType); } } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:executor 判空 ✓、NnopbaseSetHcclServerType 函数指针判空 ✓ | 0% | | | 红线#5 变量初始化:commMode 函数调用赋值 ✓、serverType 三元表达式赋值 ✓ | 0% | | | 11.1 LOG API 空指针:%s 参数为字符串字面量(非 nullptr) ✓ | 0% | | | 11.2 参数数量:1个%s + 1个参数 ✓ | 0% | | | 11.3 类型匹配:%s 匹配 const char* ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 3: aclnn_matmul_reduce_scatter_v2.cpp — 调用侧判空(Host 侧) **代码**(:357-359): ```cpp if ((executor != nullptr) && (*executor != nullptr)) { SetNnopbaseHcclServerTypeByArch(*executor); } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:双重指针 executor*executor 都判空 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 4: common_def.hHcclTypeSelector(Kernel 侧) **代码**(:597-604): ```cpp constexpr int CCU_COMM_MODE = 0; constexpr int AICPU_COMM_MODE = 1; template <int commMode> struct HcclTypeSelector { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_CCU>; }; template <> struct HcclTypeSelector<AICPU_COMM_MODE> { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_AICPU>; }; ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 编译期纯类型计算,无运行时行为 ✓ | 0% | | | API-7(动态内存):无动态分配 ✓ | 0% | | | API-2(std::):未使用 std:: ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 5: 4 个 Kernel Header — HCCL V1→V2 升级 + PRINTF 清理(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:334-337 为例): ```cpp const void* hcclInitTilingV2 = &(tilingData_->mc2InitTiling); uint64_t hcclCcTilingOffset = offsetof(Mc2Tiling::MatmulReduceScatterV2TilingData, mc2CcTiling); hccl_.InitV2(contextGM, hcclInitTilingV2); hccl_.SetCcTilingV2(hcclCcTilingOffset); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#5 变量初始化:hcclInitTilingV2hcclCcTilingOffset 声明即初始化 ✓ | 0% | | | TOPK-3 局部变量指针生命周期:hcclInitTilingV2 指向 tilingData_ 成员(GM 指针),函数内有效 ✓ | 0% | | | 3.4 sizeof 指针:offsetof 作用于类型名,非指针,用法正确 ✓ | 0% | | | PRINTF 删除:纯清理,无安全影响 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 6: 4 个 Kernel Header — .template 关键字(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:398-400 为例): ```cpp handles_[i + shift] = hccl_.template ReduceScatter<true>( cWork, recvBuffer, recvCount, dataType_, HcclReduceOp::HCCL_REDUCE_SUM, stride, repeat); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | C++ 标准要求:hccl_ 类型为 typename HcclTypeSelector<TPL_COMM_MODE>::type(依赖类型),模板成员函数必须加 template 关键字,不加则编译失败 ✓ | 0% | | | 2.1 运算溢出:i + shift 为循环索引 + 常量偏移,来自模板参数范围 ✓ | 0% | | | 3.3 数组索引:handles_[i + shift] 在循环内(for i = 0; i < MAX_HANDLE),边界由循环保证 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 7: Tiling + Graph 层 — LOG API 安全(Host 侧) **OP_LOGD 调用**(以 matmul_reduce_scatter_v2_tiling.cpp:150-152 为例): ```cpp OP_LOGD(opName_, "[COMM_MODE] Set CommEngine to %d (AICPU=%d, CCU=default) for matmul_reduce_scatter_v2.", commMode, Mc2Comm::ENGINE_AICPU); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 11.2 参数数量:2个 %d + 2个参数 ✓ | 0% | | | 11.3 类型匹配:%d 匹配 uint8_t(变参提升为 int,值范围 0~2 安全) ✓ | 0% | | | 11.1 空指针:opName_ 为类成员,无 %s 解引用风险 ✓ | 0% | **自信值:0%** → **✅ PASS** > 同类 LOG 调用共 8 处,全部通过 11.1/11.2/11.3 检查。 --- ## 三、风险点清单 **本次检视未发现安全风险。** | 代码段 | 检查项 | 判定 | |--------|--------|------| | GetCommModeFromEnv() | 红线#4/#5、4.1、TOPK-1 | ✅ PASS | | SetNnopbaseHcclServerTypeByArch() | 红线#4/#5、3.5、11.1/11.2/11.3 | ✅ PASS | | 调用侧判空 | 红线#4 双重指针 | ✅ PASS | | HcclTypeSelector | API-2/API-7 | ✅ PASS | | HCCL V2 升级 + PRINTF 清理 | 红线#5、TOPK-3、3.4 | ✅ PASS | | .template 关键字 | C++ 标准合规、3.3 数组边界 | ✅ PASS | | LOG API(8处) | 11.1/11.2/11.3 | ✅ PASS | --- ## 四、红线问题 CheckList | 红线 | 检查结果 | |------|---------| | 1. 除法/求余除零保护 | 无除法/求余操作 | | 2. 数组越界保护 | handles_[] 访问在循环边界内 | | 3. 溢出/下溢保护 | 参与运算的量均为小范围 uint8_t/uint32_t | | 4. 指针保护 | 所有指针使用前已判空 ✓ | | 5. 变量初始化 | 全部声明即初始化 ✓ | | 6. 资源申请/释放匹配 | 无动态资源申请 | --- ## 五、存疑项(非安全问题,供参考) ### 存疑 1:HcclTypeSelector 默认模板静默兜底 - **位置**:op_kernel/common_def.h:597-600 - **描述**:非 AICPU_COMM_MODE(=1) 的任何值都静默回退 CCU,不触发编译错误 - **规范参考**:TOPK-7(输入校验精神,编译期场景无运行时影响) - **建议**: ```cpp // 仅允许已知值,非法值触发编译错误 template <int commMode> struct HcclTypeSelector; // 不定义 template <> struct HcclTypeSelector<0> { using type = ...CCU; }; template <> struct HcclTypeSelector<1> { using type = ...AICPU; }; ``` ### 存疑 2:SetNnopbaseHcclServerTypeByArch 缺少未知架构处理 - **位置**:aclnn_matmul_reduce_scatter_v2.cpp:87-93 - **描述**:仅处理 DAV\_2201 / DAV\_3510,其他架构静默跳过(函数直接 return) - **建议**:添加 else 分支记录 WARNING 日志或断言 --- ## 六、总结 | 维度 | 评价 | |------|------| | 安全性 | ✅ 无安全红线违反 | | API 合规 | ✅ HCCL V2 用法正确,.template 关键字符合 C++ 标准 | | LOG 安全 | ✅ 8 处 OP_LOGD 参数数量/类型匹配 | | 可维护性 | 📝 2 项存疑(非阻塞,不影响合入) | **最终判定:PASS** ✅ See merge request: cann/ops-transformer!500219 天前
mc2算子op_kernel代码文件代际隔离 Co-authored-by: hblnb<huangbolin3@huawei.com> # message auto-generated for no-merge-commit merge: !1830 merge agmv2_csv into master mc2算子op_kernel代码文件代际隔离 Created-by: hblnb Commit-by: hblnb Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-transformer!183014 天前
调整common目录结构 Co-authored-by: hello_simida<wangyi206@huawei.com> # message auto-generated for no-merge-commit merge: !2465 merge master_v3 into master 调整common目录结构 Created-by: hello_simida Commit-by: hello_simida Merged-by: cann-robot Description: ## 描述 调整common目录调整 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-transformer!24652 个月前
MatmulReduceScatterV2 切换AICPU通信引擎 Co-authored-by: andingfangt<miaominghao@huawei.com> # message auto-generated for no-merge-commit merge: !5002 merge master into master MatmulReduceScatterV2 切换AICPU通信引擎 Created-by: andingfangt Commit-by: andingfangt Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/2423 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: # Ascend C 代码检视报告 **检视对象**:ops-transformer_AICPU eb6bffd57 — MatmulReduceScatterV2 支持环境变量切换 CCU/AICPU 通信引擎 (V2版本) **检视时间**:2026-05-13 **检视技能**:ascendc-code-review(假设检验驱动) **适用规范**:cpp-secure.mdascendc-topk.mdascendc-api.md **变更规模**:12 files, +175 / -96 --- ## 一、检视范围 | 层级 | 文件 | 变更 | |------|------|------| | API | op_api/aclnn_matmul_reduce_scatter_v2.cpp | +37 | | Graph | op_graph/matmul_reduce_scatter_v2_gen_task.cpp | +27 | | Tiling | arch35/matmul_reduce_scatter_v2_tiling.cpp | +7 | | Tiling | arch35/quant_bmm_reduce_scatter_tiling.cpp | +10 | | Tiling | matmul_reduce_scatter_tiling_base.cpp | +4 | | Kernel | arch35/matmul_a2a_vec_reduce_fp16_bf16.h | +27 (含删 PRINTF) | | Kernel | arch35/matmul_reduce_scatter_fp16_bf16.h | +49 (含删 PRINTF) | | Kernel | arch35/quant_bmm_a2a_vec_reduce_fp8_hif8.h | +27 (含删 PRINTF) | | Kernel | arch35/quant_bmm_reduce_scatter_fp8_hif8.h | +25 (含删 PRINTF) | | 公共 | op_kernel/common_def.h | +14 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt.cpp | +32 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt_tiling_key.h | +12 | --- ## 二、假设检验过程 ### 代码段 1: mc2_comm_utils.hGetCommModeFromEnv()(Host 侧) **代码**(:27-34): ```cpp inline uint8_t GetCommModeFromEnv() { auto commModeEnv = getenv(COMM_MODE_ENV); if (commModeEnv != nullptr) { return COMM_MODE_AICPU; } return COMM_MODE_CCU; } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:getenv() 返回 char*,已判空 ✓ | 0% | | | 红线#5 变量初始化:commModeEnvgetenv() 赋值 ✓ | 0% | | | 4.1 外部输入校验:环境变量已判空 ✓ | 0% | | | TOPK-1 校验返回值:已校验 ✓ | 0% | | | 无除法、无数组访问、无动态内存 | — | **自信值:0%** → **✅ PASS** --- ### 代码段 2: aclnn_matmul_reduce_scatter_v2.cppSetNnopbaseHcclServerTypeByArch()(Host 侧) **代码**(:87-93): ```cpp static void SetNnopbaseHcclServerTypeByArch(aclOpExecutor *executor) { if ((executor == nullptr) || (NnopbaseSetHcclServerType == nullptr)) { return; } if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_2201) { NnopbaseSetHcclServerType(executor, NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_MTE); } else if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_3510) { uint8_t commMode = Mc2Comm::GetCommModeFromEnv(); NnopbaseHcclServerType serverType = (commMode == Mc2Comm::COMM_MODE_AICPU) ? NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_AICPU : NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_CCU; OP_LOGD("[COMM_MODE] Set HcclServerType to %s for DAV_3510.", (commMode == Mc2Comm::COMM_MODE_AICPU) ? "AICPU" : "CCU"); NnopbaseSetHcclServerType(executor, serverType); } } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:executor 判空 ✓、NnopbaseSetHcclServerType 函数指针判空 ✓ | 0% | | | 红线#5 变量初始化:commMode 函数调用赋值 ✓、serverType 三元表达式赋值 ✓ | 0% | | | 11.1 LOG API 空指针:%s 参数为字符串字面量(非 nullptr) ✓ | 0% | | | 11.2 参数数量:1个%s + 1个参数 ✓ | 0% | | | 11.3 类型匹配:%s 匹配 const char* ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 3: aclnn_matmul_reduce_scatter_v2.cpp — 调用侧判空(Host 侧) **代码**(:357-359): ```cpp if ((executor != nullptr) && (*executor != nullptr)) { SetNnopbaseHcclServerTypeByArch(*executor); } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:双重指针 executor*executor 都判空 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 4: common_def.hHcclTypeSelector(Kernel 侧) **代码**(:597-604): ```cpp constexpr int CCU_COMM_MODE = 0; constexpr int AICPU_COMM_MODE = 1; template <int commMode> struct HcclTypeSelector { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_CCU>; }; template <> struct HcclTypeSelector<AICPU_COMM_MODE> { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_AICPU>; }; ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 编译期纯类型计算,无运行时行为 ✓ | 0% | | | API-7(动态内存):无动态分配 ✓ | 0% | | | API-2(std::):未使用 std:: ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 5: 4 个 Kernel Header — HCCL V1→V2 升级 + PRINTF 清理(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:334-337 为例): ```cpp const void* hcclInitTilingV2 = &(tilingData_->mc2InitTiling); uint64_t hcclCcTilingOffset = offsetof(Mc2Tiling::MatmulReduceScatterV2TilingData, mc2CcTiling); hccl_.InitV2(contextGM, hcclInitTilingV2); hccl_.SetCcTilingV2(hcclCcTilingOffset); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#5 变量初始化:hcclInitTilingV2hcclCcTilingOffset 声明即初始化 ✓ | 0% | | | TOPK-3 局部变量指针生命周期:hcclInitTilingV2 指向 tilingData_ 成员(GM 指针),函数内有效 ✓ | 0% | | | 3.4 sizeof 指针:offsetof 作用于类型名,非指针,用法正确 ✓ | 0% | | | PRINTF 删除:纯清理,无安全影响 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 6: 4 个 Kernel Header — .template 关键字(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:398-400 为例): ```cpp handles_[i + shift] = hccl_.template ReduceScatter<true>( cWork, recvBuffer, recvCount, dataType_, HcclReduceOp::HCCL_REDUCE_SUM, stride, repeat); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | C++ 标准要求:hccl_ 类型为 typename HcclTypeSelector<TPL_COMM_MODE>::type(依赖类型),模板成员函数必须加 template 关键字,不加则编译失败 ✓ | 0% | | | 2.1 运算溢出:i + shift 为循环索引 + 常量偏移,来自模板参数范围 ✓ | 0% | | | 3.3 数组索引:handles_[i + shift] 在循环内(for i = 0; i < MAX_HANDLE),边界由循环保证 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 7: Tiling + Graph 层 — LOG API 安全(Host 侧) **OP_LOGD 调用**(以 matmul_reduce_scatter_v2_tiling.cpp:150-152 为例): ```cpp OP_LOGD(opName_, "[COMM_MODE] Set CommEngine to %d (AICPU=%d, CCU=default) for matmul_reduce_scatter_v2.", commMode, Mc2Comm::ENGINE_AICPU); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 11.2 参数数量:2个 %d + 2个参数 ✓ | 0% | | | 11.3 类型匹配:%d 匹配 uint8_t(变参提升为 int,值范围 0~2 安全) ✓ | 0% | | | 11.1 空指针:opName_ 为类成员,无 %s 解引用风险 ✓ | 0% | **自信值:0%** → **✅ PASS** > 同类 LOG 调用共 8 处,全部通过 11.1/11.2/11.3 检查。 --- ## 三、风险点清单 **本次检视未发现安全风险。** | 代码段 | 检查项 | 判定 | |--------|--------|------| | GetCommModeFromEnv() | 红线#4/#5、4.1、TOPK-1 | ✅ PASS | | SetNnopbaseHcclServerTypeByArch() | 红线#4/#5、3.5、11.1/11.2/11.3 | ✅ PASS | | 调用侧判空 | 红线#4 双重指针 | ✅ PASS | | HcclTypeSelector | API-2/API-7 | ✅ PASS | | HCCL V2 升级 + PRINTF 清理 | 红线#5、TOPK-3、3.4 | ✅ PASS | | .template 关键字 | C++ 标准合规、3.3 数组边界 | ✅ PASS | | LOG API(8处) | 11.1/11.2/11.3 | ✅ PASS | --- ## 四、红线问题 CheckList | 红线 | 检查结果 | |------|---------| | 1. 除法/求余除零保护 | 无除法/求余操作 | | 2. 数组越界保护 | handles_[] 访问在循环边界内 | | 3. 溢出/下溢保护 | 参与运算的量均为小范围 uint8_t/uint32_t | | 4. 指针保护 | 所有指针使用前已判空 ✓ | | 5. 变量初始化 | 全部声明即初始化 ✓ | | 6. 资源申请/释放匹配 | 无动态资源申请 | --- ## 五、存疑项(非安全问题,供参考) ### 存疑 1:HcclTypeSelector 默认模板静默兜底 - **位置**:op_kernel/common_def.h:597-600 - **描述**:非 AICPU_COMM_MODE(=1) 的任何值都静默回退 CCU,不触发编译错误 - **规范参考**:TOPK-7(输入校验精神,编译期场景无运行时影响) - **建议**: ```cpp // 仅允许已知值,非法值触发编译错误 template <int commMode> struct HcclTypeSelector; // 不定义 template <> struct HcclTypeSelector<0> { using type = ...CCU; }; template <> struct HcclTypeSelector<1> { using type = ...AICPU; }; ``` ### 存疑 2:SetNnopbaseHcclServerTypeByArch 缺少未知架构处理 - **位置**:aclnn_matmul_reduce_scatter_v2.cpp:87-93 - **描述**:仅处理 DAV\_2201 / DAV\_3510,其他架构静默跳过(函数直接 return) - **建议**:添加 else 分支记录 WARNING 日志或断言 --- ## 六、总结 | 维度 | 评价 | |------|------| | 安全性 | ✅ 无安全红线违反 | | API 合规 | ✅ HCCL V2 用法正确,.template 关键字符合 C++ 标准 | | LOG 安全 | ✅ 8 处 OP_LOGD 参数数量/类型匹配 | | 可维护性 | 📝 2 项存疑(非阻塞,不影响合入) | **最终判定:PASS** ✅ See merge request: cann/ops-transformer!500219 天前
MatmulReduceScatterV2 切换AICPU通信引擎 Co-authored-by: andingfangt<miaominghao@huawei.com> # message auto-generated for no-merge-commit merge: !5002 merge master into master MatmulReduceScatterV2 切换AICPU通信引擎 Created-by: andingfangt Commit-by: andingfangt Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> https://gitcode.com/cann/ops-transformer/issues/2423 ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: # Ascend C 代码检视报告 **检视对象**:ops-transformer_AICPU eb6bffd57 — MatmulReduceScatterV2 支持环境变量切换 CCU/AICPU 通信引擎 (V2版本) **检视时间**:2026-05-13 **检视技能**:ascendc-code-review(假设检验驱动) **适用规范**:cpp-secure.mdascendc-topk.mdascendc-api.md **变更规模**:12 files, +175 / -96 --- ## 一、检视范围 | 层级 | 文件 | 变更 | |------|------|------| | API | op_api/aclnn_matmul_reduce_scatter_v2.cpp | +37 | | Graph | op_graph/matmul_reduce_scatter_v2_gen_task.cpp | +27 | | Tiling | arch35/matmul_reduce_scatter_v2_tiling.cpp | +7 | | Tiling | arch35/quant_bmm_reduce_scatter_tiling.cpp | +10 | | Tiling | matmul_reduce_scatter_tiling_base.cpp | +4 | | Kernel | arch35/matmul_a2a_vec_reduce_fp16_bf16.h | +27 (含删 PRINTF) | | Kernel | arch35/matmul_reduce_scatter_fp16_bf16.h | +49 (含删 PRINTF) | | Kernel | arch35/quant_bmm_a2a_vec_reduce_fp8_hif8.h | +27 (含删 PRINTF) | | Kernel | arch35/quant_bmm_reduce_scatter_fp8_hif8.h | +25 (含删 PRINTF) | | 公共 | op_kernel/common_def.h | +14 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt.cpp | +32 | | 公共 | op_kernel/matmul_reduce_scatter_v2_apt_tiling_key.h | +12 | --- ## 二、假设检验过程 ### 代码段 1: mc2_comm_utils.hGetCommModeFromEnv()(Host 侧) **代码**(:27-34): ```cpp inline uint8_t GetCommModeFromEnv() { auto commModeEnv = getenv(COMM_MODE_ENV); if (commModeEnv != nullptr) { return COMM_MODE_AICPU; } return COMM_MODE_CCU; } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:getenv() 返回 char*,已判空 ✓ | 0% | | | 红线#5 变量初始化:commModeEnvgetenv() 赋值 ✓ | 0% | | | 4.1 外部输入校验:环境变量已判空 ✓ | 0% | | | TOPK-1 校验返回值:已校验 ✓ | 0% | | | 无除法、无数组访问、无动态内存 | — | **自信值:0%** → **✅ PASS** --- ### 代码段 2: aclnn_matmul_reduce_scatter_v2.cppSetNnopbaseHcclServerTypeByArch()(Host 侧) **代码**(:87-93): ```cpp static void SetNnopbaseHcclServerTypeByArch(aclOpExecutor *executor) { if ((executor == nullptr) || (NnopbaseSetHcclServerType == nullptr)) { return; } if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_2201) { NnopbaseSetHcclServerType(executor, NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_MTE); } else if (GetCurrentPlatformInfo().GetCurNpuArch() == NpuArch::DAV_3510) { uint8_t commMode = Mc2Comm::GetCommModeFromEnv(); NnopbaseHcclServerType serverType = (commMode == Mc2Comm::COMM_MODE_AICPU) ? NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_AICPU : NnopbaseHcclServerType::NNOPBASE_HCCL_SERVER_TYPE_CCU; OP_LOGD("[COMM_MODE] Set HcclServerType to %s for DAV_3510.", (commMode == Mc2Comm::COMM_MODE_AICPU) ? "AICPU" : "CCU"); NnopbaseSetHcclServerType(executor, serverType); } } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:executor 判空 ✓、NnopbaseSetHcclServerType 函数指针判空 ✓ | 0% | | | 红线#5 变量初始化:commMode 函数调用赋值 ✓、serverType 三元表达式赋值 ✓ | 0% | | | 11.1 LOG API 空指针:%s 参数为字符串字面量(非 nullptr) ✓ | 0% | | | 11.2 参数数量:1个%s + 1个参数 ✓ | 0% | | | 11.3 类型匹配:%s 匹配 const char* ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 3: aclnn_matmul_reduce_scatter_v2.cpp — 调用侧判空(Host 侧) **代码**(:357-359): ```cpp if ((executor != nullptr) && (*executor != nullptr)) { SetNnopbaseHcclServerTypeByArch(*executor); } ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#4 指针保护:双重指针 executor*executor 都判空 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 4: common_def.hHcclTypeSelector(Kernel 侧) **代码**(:597-604): ```cpp constexpr int CCU_COMM_MODE = 0; constexpr int AICPU_COMM_MODE = 1; template <int commMode> struct HcclTypeSelector { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_CCU>; }; template <> struct HcclTypeSelector<AICPU_COMM_MODE> { using type = AscendC::Hccl<AscendC::HcclServerType::HCCL_SERVER_TYPE_AICPU>; }; ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 编译期纯类型计算,无运行时行为 ✓ | 0% | | | API-7(动态内存):无动态分配 ✓ | 0% | | | API-2(std::):未使用 std:: ✓ | 0% | **自信值:0%(无安全风险)** → **✅ PASS** --- ### 代码段 5: 4 个 Kernel Header — HCCL V1→V2 升级 + PRINTF 清理(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:334-337 为例): ```cpp const void* hcclInitTilingV2 = &(tilingData_->mc2InitTiling); uint64_t hcclCcTilingOffset = offsetof(Mc2Tiling::MatmulReduceScatterV2TilingData, mc2CcTiling); hccl_.InitV2(contextGM, hcclInitTilingV2); hccl_.SetCcTilingV2(hcclCcTilingOffset); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 红线#5 变量初始化:hcclInitTilingV2hcclCcTilingOffset 声明即初始化 ✓ | 0% | | | TOPK-3 局部变量指针生命周期:hcclInitTilingV2 指向 tilingData_ 成员(GM 指针),函数内有效 ✓ | 0% | | | 3.4 sizeof 指针:offsetof 作用于类型名,非指针,用法正确 ✓ | 0% | | | PRINTF 删除:纯清理,无安全影响 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 6: 4 个 Kernel Header — .template 关键字(Kernel 侧) **代码**(以 matmul_reduce_scatter_fp16_bf16.h:398-400 为例): ```cpp handles_[i + shift] = hccl_.template ReduceScatter<true>( cWork, recvBuffer, recvCount, dataType_, HcclReduceOp::HCCL_REDUCE_SUM, stride, repeat); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | C++ 标准要求:hccl_ 类型为 typename HcclTypeSelector<TPL_COMM_MODE>::type(依赖类型),模板成员函数必须加 template 关键字,不加则编译失败 ✓ | 0% | | | 2.1 运算溢出:i + shift 为循环索引 + 常量偏移,来自模板参数范围 ✓ | 0% | | | 3.3 数组索引:handles_[i + shift] 在循环内(for i = 0; i < MAX_HANDLE),边界由循环保证 ✓ | 0% | **自信值:0%** → **✅ PASS** --- ### 代码段 7: Tiling + Graph 层 — LOG API 安全(Host 侧) **OP_LOGD 调用**(以 matmul_reduce_scatter_v2_tiling.cpp:150-152 为例): ```cpp OP_LOGD(opName_, "[COMM_MODE] Set CommEngine to %d (AICPU=%d, CCU=default) for matmul_reduce_scatter_v2.", commMode, Mc2Comm::ENGINE_AICPU); ``` | 假设 | 证据收集 | 自信值增量 | |------|---------|-----------| | H1: 存在风险 | 11.2 参数数量:2个 %d + 2个参数 ✓ | 0% | | | 11.3 类型匹配:%d 匹配 uint8_t(变参提升为 int,值范围 0~2 安全) ✓ | 0% | | | 11.1 空指针:opName_ 为类成员,无 %s 解引用风险 ✓ | 0% | **自信值:0%** → **✅ PASS** > 同类 LOG 调用共 8 处,全部通过 11.1/11.2/11.3 检查。 --- ## 三、风险点清单 **本次检视未发现安全风险。** | 代码段 | 检查项 | 判定 | |--------|--------|------| | GetCommModeFromEnv() | 红线#4/#5、4.1、TOPK-1 | ✅ PASS | | SetNnopbaseHcclServerTypeByArch() | 红线#4/#5、3.5、11.1/11.2/11.3 | ✅ PASS | | 调用侧判空 | 红线#4 双重指针 | ✅ PASS | | HcclTypeSelector | API-2/API-7 | ✅ PASS | | HCCL V2 升级 + PRINTF 清理 | 红线#5、TOPK-3、3.4 | ✅ PASS | | .template 关键字 | C++ 标准合规、3.3 数组边界 | ✅ PASS | | LOG API(8处) | 11.1/11.2/11.3 | ✅ PASS | --- ## 四、红线问题 CheckList | 红线 | 检查结果 | |------|---------| | 1. 除法/求余除零保护 | 无除法/求余操作 | | 2. 数组越界保护 | handles_[] 访问在循环边界内 | | 3. 溢出/下溢保护 | 参与运算的量均为小范围 uint8_t/uint32_t | | 4. 指针保护 | 所有指针使用前已判空 ✓ | | 5. 变量初始化 | 全部声明即初始化 ✓ | | 6. 资源申请/释放匹配 | 无动态资源申请 | --- ## 五、存疑项(非安全问题,供参考) ### 存疑 1:HcclTypeSelector 默认模板静默兜底 - **位置**:op_kernel/common_def.h:597-600 - **描述**:非 AICPU_COMM_MODE(=1) 的任何值都静默回退 CCU,不触发编译错误 - **规范参考**:TOPK-7(输入校验精神,编译期场景无运行时影响) - **建议**: ```cpp // 仅允许已知值,非法值触发编译错误 template <int commMode> struct HcclTypeSelector; // 不定义 template <> struct HcclTypeSelector<0> { using type = ...CCU; }; template <> struct HcclTypeSelector<1> { using type = ...AICPU; }; ``` ### 存疑 2:SetNnopbaseHcclServerTypeByArch 缺少未知架构处理 - **位置**:aclnn_matmul_reduce_scatter_v2.cpp:87-93 - **描述**:仅处理 DAV\_2201 / DAV\_3510,其他架构静默跳过(函数直接 return) - **建议**:添加 else 分支记录 WARNING 日志或断言 --- ## 六、总结 | 维度 | 评价 | |------|------| | 安全性 | ✅ 无安全红线违反 | | API 合规 | ✅ HCCL V2 用法正确,.template 关键字符合 C++ 标准 | | LOG 安全 | ✅ 8 处 OP_LOGD 参数数量/类型匹配 | | 可维护性 | 📝 2 项存疑(非阻塞,不影响合入) | **最终判定:PASS** ✅ See merge request: cann/ops-transformer!500219 天前