| docs(gmm): 明确MXFP8量化中存储block与group size的概念区分 Co-authored-by: zhoushaolong<zhoushaolong3@huawei.com> # message auto-generated for no-merge-commit merge: !9736 merge gmmaqziliao0807 into master docs(gmm): 明确MXFP8量化中存储block与group size的概念区分 Created-by: zhoushaolong Commit-by: zhoushaolong Merged-by: cann-robot Description: ## 描述 明确 aclnnGroupedMatmulActivationQuantWeightNz 算子文档中 MXFP8 量化的"存储block大小"与"MX量化group大小"两个概念,消除原表述统一使用 blocksize 造成的混淆。 ### 改动原因 原文档统一用 blocksize 描述 MXFP8 量化的分组大小,未区分两个不同概念: - 存储block大小(64):量化结果的存储块大小 - MX量化group大小(32):MX标准中共享指数的分组大小(一个存储block包含2个group) 两者数值不同,混用会导致读者对量化分组逻辑(尤其 scaleAlg=0 与 scaleAlg=1 两种场景)理解偏差。 ### 改动方法 1. 修正 blocksize 定义:明确为"MX量化结果的存储block大小,当前仅支持64,对应2个MX量化group,每个group包含32个元素"。 2. 场景1(scaleAlg=0,OCP实现):将量化分组参数从 k=blocksize 改为 group_size=32,明确按MX量化group(32元素)分组。 3. 场景2(scaleAlg=1,cuBLAS实现):将分组参数从 k=blocksize 改为 blocksize=64,明确按存储block(64元素)分组。 4. 在 xScale / outputScale 的 shape 表后补充说明:第三维为2,表示每个64元素的存储block包含2个MX量化group,每个group覆盖32个元素。 ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/4170 ## 测试 纯文档改动,不涉及代码逻辑变更,无需测试。 ## 文档更新 更新了 gmm/grouped_matmul_activation_quant/docs/aclnnGroupedMatmulActivationQuantWeightNz.md:明确 MXFP8 存储block(64)与量化group(32)的概念区分,修正 scaleAlg=0/1 两种场景的分组参数表述。 ## 类型标签 - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [x] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!9736 | 3 天前 |