| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
950支持BlockSparseAttentionGrad算子 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6186 merge arc35_bsa_final into master 950支持BlockSparseAttentionGrad算子 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> MIT Han Lab 的 [Block-Sparse-Attention](https://github.com/mit-han-lab/Block-Sparse-Attention) 项目已实现一套完整的稀疏注意力CUDA核函数,支持在GPU上进行块稀疏注意力的高性能训练与推理。 本PR基于昇腾950支持了 Block-Sparse-Attention-Grad算子。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#2841](https://gitcode.com/cann/ops-transformer/issues/2841) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6186 | 1 个月前 | |
【BSAG算子】【950】新增shape、dytpe、format拦截 Co-authored-by: xuchengyang<353818022@qq.com> # message auto-generated for no-merge-commit merge: !8125 merge dtype_check into master 【BSAG算子】【950】新增shape、dytpe、format拦截 Created-by: xuchengyang Commit-by: xuchengyang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本PR主要对aclnn_block_sparse_attention_grad算子的参数校验逻辑进行了重构和增强:新增了对输入/输出张量的dtype、format和shape的全面拦截校验,并将原来离散的函数参数统一收敛到BSAGParams结构体中。同时修复了tiling模块中InputCheck调用时错误地将q_head_dim用于key和value头维度的问题。 主要改动 新增dtype全面检查: 在ValidateParams中用CHECK_COND替换了原有的CheckDataType函数,校验范围从query/key/value扩展至所有10个张量(含attentionOut、attentionOutGrad、softmaxLse、blockSparseMaskOptional、dqOut、dkOut、dvOut),对每个张量的dtype与query进行匹配校验,softmaxLse限定为FLOAT32,blockSparseMask限定为BOOL或UINT8 新增format检查: 对所有输入/输出张量检查GetStorageFormat()是否为FORMAT_ND,非ND格式仅输出OP_LOGW警告而不阻断执行 新增shape检查: 根据qInputLayout(BNSD或TND)对不同布局下各张量的指定维度进行一致性校验,如BNSD下校验dim[0](batch)和dim[3](head_dim),TND下校验dim[2](head_dim) 引入BSAGParams结构体: 将所有参数(11个张量指针、layout字符串、maskType等)聚合为BSAGParams结构体,ValidateParams签名简化为ValidateParams(const BSAGParams& params),在aclnnBlockSparseAttentionGrad入口处统一填充后传入 修复tiling层头维度参数错误: block_sparse_attention_grad_tiling_arch35.cpp中,InputCheck调用key和value的头维度参数从错误的q_head_dim修正为k_head_dim和v_head_dim ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8125 | 20 天前 | |
【BSAG】【950】 性能优化 Co-authored-by: xuchengyang<353818022@qq.com> # message auto-generated for no-merge-commit merge: !8510 merge bsag_trans_opt into master 【BSAG】【950】 性能优化 Created-by: xuchengyang Commit-by: xuchengyang Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 本PR针对 Block Sparse Attention Grad(BSAG)算子进行性能优化,主要涉及三个层面的改动:在特定NPU架构(DAV_3510)上对 blockSparseMaskOptional 张量进行转置以改善内存访问模式;调整 addr_compute.h 中循环遍历顺序,从原来的 s2→s1→n1→batch 改为 s1→s2→n1→batch;以及修正 common_header.h 中 IsValidBlock 函数的稀疏掩码索引计算方式,交换了 q_block_idx 与 kv_block_idx 的计算位置。这些改动协同作用,优化了算子在 Ascend 硬件上的计算效率。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [ ] ✨ 新特性 - [x] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!8510 | 14 天前 | |
【BlockSparseAttentionGrad】修复Sparse场景精度问题 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6959 merge bsag_update into master 【BlockSparseAttentionGrad】修复Sparse场景精度问题 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 修复Sparse场景精度问题 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#3150](https://gitcode.com/cann/ops-transformer/issues/3150) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6959 | 1 个月前 | |
950支持BlockSparseAttentionGrad算子 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6186 merge arc35_bsa_final into master 950支持BlockSparseAttentionGrad算子 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> MIT Han Lab 的 [Block-Sparse-Attention](https://github.com/mit-han-lab/Block-Sparse-Attention) 项目已实现一套完整的稀疏注意力CUDA核函数,支持在GPU上进行块稀疏注意力的高性能训练与推理。 本PR基于昇腾950支持了 Block-Sparse-Attention-Grad算子。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#2841](https://gitcode.com/cann/ops-transformer/issues/2841) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6186 | 1 个月前 | |
950支持BlockSparseAttentionGrad算子 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6186 merge arc35_bsa_final into master 950支持BlockSparseAttentionGrad算子 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> MIT Han Lab 的 [Block-Sparse-Attention](https://github.com/mit-han-lab/Block-Sparse-Attention) 项目已实现一套完整的稀疏注意力CUDA核函数,支持在GPU上进行块稀疏注意力的高性能训练与推理。 本PR基于昇腾950支持了 Block-Sparse-Attention-Grad算子。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#2841](https://gitcode.com/cann/ops-transformer/issues/2841) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6186 | 1 个月前 | |
950支持BlockSparseAttentionGrad算子 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6186 merge arc35_bsa_final into master 950支持BlockSparseAttentionGrad算子 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> MIT Han Lab 的 [Block-Sparse-Attention](https://github.com/mit-han-lab/Block-Sparse-Attention) 项目已实现一套完整的稀疏注意力CUDA核函数,支持在GPU上进行块稀疏注意力的高性能训练与推理。 本PR基于昇腾950支持了 Block-Sparse-Attention-Grad算子。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#2841](https://gitcode.com/cann/ops-transformer/issues/2841) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6186 | 1 个月前 | |
【BlockSparseAttentionGrad】修复Sparse场景精度问题 Co-authored-by: 徐诚阳<xuchengyang2@h-partners.com> # message auto-generated for no-merge-commit merge: !6959 merge bsag_update into master 【BlockSparseAttentionGrad】修复Sparse场景精度问题 Created-by: xuchengyang Commit-by: 徐诚阳 Merged-by: cann-robot Description: ## 描述 <!--在这里详细描述你的改动,包括改动的原因和所采取的方法。--> 修复Sparse场景精度问题 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #000--> <!-- 如果这个PR是为了解决特定的问题单,请在这里描述问题单单号。--> 关联Issue [#3150](https://gitcode.com/cann/ops-transformer/issues/3150) ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6959 | 1 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 20 天前 | ||
| 14 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 |