| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
修复block_epilogue_dequant.hpp中VF静态函数的问题 Co-authored-by: zhaohujie<zhaohujie@huawei.com> # message auto-generated for no-merge-commit merge: !1075 merge br.sivf.fix into master 修复block_epilogue_dequant.hpp中VF静态函数的问题 Created-by: init__zhb__ Commit-by: zhaohujie Merged-by: cann-robot Description: ## 描述 将 VFDoDequant静态函数(使用__simd_vf__修饰) 的函数体放在类内 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。--> ## 原因 <!--说明此次改动的目的、解决的问题等,应与类型标签匹配 --> ## 测试 基于CANN 9.2.0 版本验证编译无问题。   ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] Bug修复 - [ ] 新特性 - [ ] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/catlass!1075 | 25 天前 | |
增加grouped_mx_A8w4_matmul模版 Co-authored-by: UniquePG<chenkaipeng4@huawei.com> # message auto-generated for no-merge-commit merge: !843 merge nd_change into master 增加grouped_mx_A8w4_matmul模版 Created-by: UniquePG Commit-by: UniquePG Merged-by: cann-robot Description: ## 描述 此 PR 新增了 Ascend950 平台上的 A8W4 grouped MX matrix multiplication 内核模板,支持分组矩阵乘法(多专家场景),其中 A 矩阵为 FP8(E4M3)量化、B 矩阵为 FP4(E2M1)量化带 MX scale。核心改动包括:新增 A8W4GroupedMxMatmul 内核类实现 AIC/AIV 双核协同的分组计算逻辑、新增 BlockPrologue 的 MxGroupedA8W4Prologue 特化负责 AIV 侧 B 矩阵反量化、为 MmadA8W4Mx 引入 L1_SCALE_FACTOR_K 参数支持跨 K 迭代的 scale 复用优化;同时修改example 59 A8W4MxMatmul相关kernel与host侧代码,使其共用block层代码。 性能测试数据如链接所示:<https://dcnucy7udkr0.feishu.cn/wiki/Mpqrw4t0Mi31O4kAAl9ctM1Lnxf?sheet=s4xNTJ> 本例较标杆性能提升10% ## 关联的Issue 无 ## 文档更新 **重构 block_mmad_mx_a8w4.hpp; block_mx_a8w4_prologue.hpp** 优化AIV双缓冲逻辑;增加scale合并加载优化;重构原prologue的反量化逻辑,修改传入nZ格式B矩阵时的反量化逻辑;修改原nd格式下双缓冲等bug问题 **重构 a8w4_mx.cpp; a8w4_mx_matmul.hpp** 修改原example 59相关的kernel与host侧代码,共用block层代码 ## 类型标签 <!-- [x] 表示选中 --> - [x] Bug修复 - [x] 新特性 - [x] 性能优化 - [ ] 文档更新 - [ ] 其他,请描述: See merge request: cann/catlass!843 | 1 个月前 |