| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
feat(test): rotm,rotmg,dotex适配混合容差精度验证 Co-authored-by: LuckySun<sunwenlong8@huawei.com> # message auto-generated for no-merge-commit merge: !296 merge mix into master feat(test): rotm,rotmg,dotex适配混合容差精度验证 Created-by: LuckySun Commit-by: LuckySun Merged-by: cann-robot Description: ## 描述 rotm、rotmg、dotex 三个算子适配新增的混合容差精度标准(applyMixedTolerance),替代原有手动 MERE_MARE/EXACT/REL 精度校验模式。 变更内容: - test.cpp:将手动精度配置(MERE_MARE/EXACT/REL)替换为 applyMixedTolerance 接口调用 - CSV:移除 mere_threshold、mare_multiplier 列 ## 关联的Issue https://gitcode.com/cann/ops-blas/issues/321 ## 测试 bash build.sh --soc=ascend950 --ops=rotm,rotmg,dotex --run  - rotm: 57 tests PASSED - rotmg: 61 tests PASSED - dotex: 45 tests PASSED ## 文档更新 无 ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [x] 其他,请描述:适配新精度标准 See merge request: cann/ops-blas!296 | 2 个月前 | |
Feat: 新增面向arch35的aclblasDotEx接口 Co-authored-by: LuckySun<sunwenlong8@huawei.com> # message auto-generated for no-merge-commit merge: !262 merge aclblasDotEx into master Feat: 新增面向arch35的aclblasDotEx接口 Created-by: LuckySun Commit-by: LuckySun Merged-by: cann-robot Description: ## 描述 新增面向 arch35(Ascend 950) 的扩展点积接口 aclblasDotEx,对标 cuBLAS cublasDotEx。 接口签名: cpp aclblasStatus_t aclblasDotEx(aclblasHandle_t handle, int n, const void* x, aclDataType xType, int incx, const void* y, aclDataType yType, int incy, void* result, aclDataType resultType, aclDataType executionType); 支持 FP32/FP16/BF16 三种输入类型,内部统一以 FP32 精度计算,result 类型与输入类型一致。 实现采用双路径策略: - incx == incy && |incx| == 1:SIMD regbase 路径,Mul + ReduceSum 向量化,多核切分 + 跨核归约 - 其余情况:SIMT grid-stride 路径,各线程独立寻址累加,写 per-thread 槽位 + asc_syncthreads + thread 0 串行归约 → 跨核同步 → Core 0 最终 ReduceSum UB 分配采用权重法正比例计算,双缓冲 TQue 流水线。Workspace 布局: [per-thread: useCoreNum × numThreads] [per-core: useCoreNum] SIMT 路径各线程先写 per-thread 槽位,thread 0 归约后写入 per-core 区域,Core 0 从 per-core 区域连续读取做最终归约。 ## 关联的Issue https://gitcode.com/cann/ops-blas/issues/307 ## 测试  ## 文档更新 新增 blas/dotex/README.md。 ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-blas!262 | 2 个月前 | |
Feat: 新增面向arch35的aclblasDotEx接口 Co-authored-by: LuckySun<sunwenlong8@huawei.com> # message auto-generated for no-merge-commit merge: !262 merge aclblasDotEx into master Feat: 新增面向arch35的aclblasDotEx接口 Created-by: LuckySun Commit-by: LuckySun Merged-by: cann-robot Description: ## 描述 新增面向 arch35(Ascend 950) 的扩展点积接口 aclblasDotEx,对标 cuBLAS cublasDotEx。 接口签名: cpp aclblasStatus_t aclblasDotEx(aclblasHandle_t handle, int n, const void* x, aclDataType xType, int incx, const void* y, aclDataType yType, int incy, void* result, aclDataType resultType, aclDataType executionType); 支持 FP32/FP16/BF16 三种输入类型,内部统一以 FP32 精度计算,result 类型与输入类型一致。 实现采用双路径策略: - incx == incy && |incx| == 1:SIMD regbase 路径,Mul + ReduceSum 向量化,多核切分 + 跨核归约 - 其余情况:SIMT grid-stride 路径,各线程独立寻址累加,写 per-thread 槽位 + asc_syncthreads + thread 0 串行归约 → 跨核同步 → Core 0 最终 ReduceSum UB 分配采用权重法正比例计算,双缓冲 TQue 流水线。Workspace 布局: [per-thread: useCoreNum × numThreads] [per-core: useCoreNum] SIMT 路径各线程先写 per-thread 槽位,thread 0 归约后写入 per-core 区域,Core 0 从 per-core 区域连续读取做最终归约。 ## 关联的Issue https://gitcode.com/cann/ops-blas/issues/307 ## 测试  ## 文档更新 新增 blas/dotex/README.md。 ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-blas!262 | 2 个月前 | |
Feat: 新增面向arch35的aclblasDotEx接口 Co-authored-by: LuckySun<sunwenlong8@huawei.com> # message auto-generated for no-merge-commit merge: !262 merge aclblasDotEx into master Feat: 新增面向arch35的aclblasDotEx接口 Created-by: LuckySun Commit-by: LuckySun Merged-by: cann-robot Description: ## 描述 新增面向 arch35(Ascend 950) 的扩展点积接口 aclblasDotEx,对标 cuBLAS cublasDotEx。 接口签名: cpp aclblasStatus_t aclblasDotEx(aclblasHandle_t handle, int n, const void* x, aclDataType xType, int incx, const void* y, aclDataType yType, int incy, void* result, aclDataType resultType, aclDataType executionType); 支持 FP32/FP16/BF16 三种输入类型,内部统一以 FP32 精度计算,result 类型与输入类型一致。 实现采用双路径策略: - incx == incy && |incx| == 1:SIMD regbase 路径,Mul + ReduceSum 向量化,多核切分 + 跨核归约 - 其余情况:SIMT grid-stride 路径,各线程独立寻址累加,写 per-thread 槽位 + asc_syncthreads + thread 0 串行归约 → 跨核同步 → Core 0 最终 ReduceSum UB 分配采用权重法正比例计算,双缓冲 TQue 流水线。Workspace 布局: [per-thread: useCoreNum × numThreads] [per-core: useCoreNum] SIMT 路径各线程先写 per-thread 槽位,thread 0 归约后写入 per-core 区域,Core 0 从 per-core 区域连续读取做最终归约。 ## 关联的Issue https://gitcode.com/cann/ops-blas/issues/307 ## 测试  ## 文档更新 新增 blas/dotex/README.md。 ## 类型标签 - [ ] Bug修复 - [x] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/ops-blas!262 | 2 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 2 个月前 | ||
| 2 个月前 | ||
| 2 个月前 | ||
| 2 个月前 |