| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
新增kvCompressEpilog和indexerQunatCache算子 Co-authored-by: zhu-lei0614<zhulei113@huawei.com> # message auto-generated for no-merge-commit merge: !6519 merge master into master 新增kvCompressEpilog和indexerQunatCache算子 Created-by: zhu-lei0614 Commit-by: zhu-lei0614 Merged-by: cann-robot Description: ## 描述 新增kvCompressEpilog和indexerQunatCache算子 ## 关联的Issue 关联issue:https://gitcode.com/cann/ops-transformer/issues/3103 ## 测试 本地验证测试通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6519 | 2 个月前 | |
新增kvCompressEpilog和indexerQunatCache算子 Co-authored-by: zhu-lei0614<zhulei113@huawei.com> # message auto-generated for no-merge-commit merge: !6519 merge master into master 新增kvCompressEpilog和indexerQunatCache算子 Created-by: zhu-lei0614 Commit-by: zhu-lei0614 Merged-by: cann-robot Description: ## 描述 新增kvCompressEpilog和indexerQunatCache算子 ## 关联的Issue 关联issue:https://gitcode.com/cann/ops-transformer/issues/3103 ## 测试 本地验证测试通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6519 | 2 个月前 | |
新增kvCompressEpilog和indexerQunatCache算子 Co-authored-by: zhu-lei0614<zhulei113@huawei.com> # message auto-generated for no-merge-commit merge: !6519 merge master into master 新增kvCompressEpilog和indexerQunatCache算子 Created-by: zhu-lei0614 Commit-by: zhu-lei0614 Merged-by: cann-robot Description: ## 描述 新增kvCompressEpilog和indexerQunatCache算子 ## 关联的Issue 关联issue:https://gitcode.com/cann/ops-transformer/issues/3103 ## 测试 本地验证测试通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6519 | 2 个月前 | |
新增kvCompressEpilog和indexerQunatCache算子 Co-authored-by: zhu-lei0614<zhulei113@huawei.com> # message auto-generated for no-merge-commit merge: !6519 merge master into master 新增kvCompressEpilog和indexerQunatCache算子 Created-by: zhu-lei0614 Commit-by: zhu-lei0614 Merged-by: cann-robot Description: ## 描述 新增kvCompressEpilog和indexerQunatCache算子 ## 关联的Issue 关联issue:https://gitcode.com/cann/ops-transformer/issues/3103 ## 测试 本地验证测试通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6519 | 2 个月前 | |
add kv_compress_epilog和indexer_quant_cache的PTA接口 Co-authored-by: zhu-lei0614<zhulei113@huawei.com> # message auto-generated for no-merge-commit merge: !6967 merge master into master add kv_compress_epilog和indexer_quant_cache的PTA接口 Created-by: zhu-lei0614 Commit-by: zhu-lei0614 Merged-by: cann-robot Description: ## 描述 add kv_compress_epilog和indexer_quant_cache的PTA接口 ## 关联的Issue https://gitcode.com/cann/ops-transformer/issues/3191 ## 测试 本地验证已通过 ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 Bug修复 - [x] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [ ] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!6967 | 1 个月前 | |
fix(indexer_quant_cache): reject odd cache headDim for MX-FP4 mode Co-authored-by: wangxun21<wangxun21@huawei.com> # message auto-generated for no-merge-commit merge: !9613 merge fix/indexer-quant-cache-mxfp4-odd-headdim into master fix(indexer_quant_cache): reject odd cache headDim for MX-FP4 mode Created-by: wangxun21 Commit-by: wangxun21 Merged-by: cann-robot Description: ## 描述 修复 indexer_quant_cache 算子在 quantMode=3(MX-FP4)模式下,cache.headDim 为奇数时产生精度错误/数据错位的问题。 **根因**:MX-FP4 每字节打包 2 个 fp4 逻辑元素。当 headDim 为奇数时,相邻逻辑行的起始位置会交替落在字节的高 4 位 / 低 4 位。当前 kernel 把 cache 声明为 GlobalTensor<int8_t>,仅支持整字节地址的 CopyOut,无法表达这种半字节偏移,导致输出数据错位/精度错误。 **修复方案**:在 host tiling (indexer_quant_cache_tiling_arch35.cpp) 的 CalcOpTiling 中新增校验——quantMode=3 时要求 cache.headDim(连续场景)以及 cache 分页 view 的 row/block stride(分页场景)必须为偶数,不满足则直接返回 GRAPH_FAILED,从"跑出错误数据"变为"直接报错拒绝非法输入"。同步更新文档约束说明,并新增 host UT 拒绝用例。 该做法与 CANN 内其他 FP4/MX-FP4 打包量化算子(如 scatter_pa_kv_cache 对 k_head_size/v_head_size 的偶数校验、dynamic_mx_quant 对 input.shape[-1] 的偶数要求)保持一致——均选择在 host tiling 阶段拒绝奇数尾轴,而不是尝试支持半字节寻址。 ## 关联的Issue 关联 Issue #4137 ## 测试 - **端到端验证**:用 TTK aclnn 模式构造了 headDim=65(奇数)和 headDim=64(偶数)两个 MX-FP4 用例,前者 aclnnIndexerQuantCacheGetWorkspaceSize 阶段报错拒绝(ACLNN_ERR_INNER_NULLPTR),plog 确认报错发生在 indexer_quant_cache_tiling_arch35.cpp:332,未进入 kernel;后者正常执行,精度 PASS。 - **Host UT**:新增测试用例 indexer_quant_cache_tiling_mxfp4_odd_headdim_rejected,验证奇数 headDim(129)在 tiling 阶段返回 GRAPH_FAILED。(本机 host UT 框架本身有环境问题——TilingContext 构造为空指针、所有用例均 segfault,与本次改动无关,已用 gdb 确认崩溃点在框架代码 tiling_case_executor.cpp:316 而非算子逻辑) ## 文档更新 更新了 attention/indexer_quant_cache/docs/aclnnIndexerQuantCache.md 的约束说明,新增一条: > **MX-FP4(quantMode=3)模式下,cache.headDim 必须为偶数**。 ## 类型标签 - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [x] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!9613 | 12 天前 | |
fix(indexer_quant_cache): reject odd cache headDim for MX-FP4 mode Co-authored-by: wangxun21<wangxun21@huawei.com> # message auto-generated for no-merge-commit merge: !9613 merge fix/indexer-quant-cache-mxfp4-odd-headdim into master fix(indexer_quant_cache): reject odd cache headDim for MX-FP4 mode Created-by: wangxun21 Commit-by: wangxun21 Merged-by: cann-robot Description: ## 描述 修复 indexer_quant_cache 算子在 quantMode=3(MX-FP4)模式下,cache.headDim 为奇数时产生精度错误/数据错位的问题。 **根因**:MX-FP4 每字节打包 2 个 fp4 逻辑元素。当 headDim 为奇数时,相邻逻辑行的起始位置会交替落在字节的高 4 位 / 低 4 位。当前 kernel 把 cache 声明为 GlobalTensor<int8_t>,仅支持整字节地址的 CopyOut,无法表达这种半字节偏移,导致输出数据错位/精度错误。 **修复方案**:在 host tiling (indexer_quant_cache_tiling_arch35.cpp) 的 CalcOpTiling 中新增校验——quantMode=3 时要求 cache.headDim(连续场景)以及 cache 分页 view 的 row/block stride(分页场景)必须为偶数,不满足则直接返回 GRAPH_FAILED,从"跑出错误数据"变为"直接报错拒绝非法输入"。同步更新文档约束说明,并新增 host UT 拒绝用例。 该做法与 CANN 内其他 FP4/MX-FP4 打包量化算子(如 scatter_pa_kv_cache 对 k_head_size/v_head_size 的偶数校验、dynamic_mx_quant 对 input.shape[-1] 的偶数要求)保持一致——均选择在 host tiling 阶段拒绝奇数尾轴,而不是尝试支持半字节寻址。 ## 关联的Issue 关联 Issue #4137 ## 测试 - **端到端验证**:用 TTK aclnn 模式构造了 headDim=65(奇数)和 headDim=64(偶数)两个 MX-FP4 用例,前者 aclnnIndexerQuantCacheGetWorkspaceSize 阶段报错拒绝(ACLNN_ERR_INNER_NULLPTR),plog 确认报错发生在 indexer_quant_cache_tiling_arch35.cpp:332,未进入 kernel;后者正常执行,精度 PASS。 - **Host UT**:新增测试用例 indexer_quant_cache_tiling_mxfp4_odd_headdim_rejected,验证奇数 headDim(129)在 tiling 阶段返回 GRAPH_FAILED。(本机 host UT 框架本身有环境问题——TilingContext 构造为空指针、所有用例均 segfault,与本次改动无关,已用 gdb 确认崩溃点在框架代码 tiling_case_executor.cpp:316 而非算子逻辑) ## 文档更新 更新了 attention/indexer_quant_cache/docs/aclnnIndexerQuantCache.md 的约束说明,新增一条: > **MX-FP4(quantMode=3)模式下,cache.headDim 必须为偶数**。 ## 类型标签 - [x] 🐛 Bug修复 - [ ] ✨ 新特性 - [ ] ⚡ 性能优化 - [ ] ♻️ 重构 - [ ] 🧪 测试 - [ ] 📦 构建/CI - [ ] 🔧 配置变更 - [x] 📝 文档更新 - [ ] ⬆️ 依赖升级 - [ ] 🔒 安全修复 - [ ] 🧹 代码清理 - [ ] ❓ 其他,请描述: See merge request: cann/ops-transformer!9613 | 12 天前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 2 个月前 | ||
| 2 个月前 | ||
| 2 个月前 | ||
| 2 个月前 | ||
| 1 个月前 | ||
| 12 天前 | ||
| 12 天前 |