| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
feat: quant_flash_attn and quant_flash_attn_metadata operators Co-authored-by: lijinxi<lijinxi2@huawei.com> # message auto-generated for no-merge-commit merge: !313 merge dev into dev feat: quant_flash_attn and quant_flash_attn_metadata operators Created-by: weixin_44144262 Commit-by: lijinxi Merged-by: ascend-robot Description: # Which issue(s) this PR fixes or accomplishes > Fix part of #136 # Purpose 新增mxfp4的fa算子,配套的还有一个aicpu的metadata算子 # Test Plan 运行tests/ops/quant_flash_attn/quant_flash_attn_golden.py测试单算子精度 # Test Report  See merge request: Ascend/MindIE-SD!313 | 2 个月前 | |
feat: quant_flash_attn and quant_flash_attn_metadata operators Co-authored-by: lijinxi<lijinxi2@huawei.com> # message auto-generated for no-merge-commit merge: !313 merge dev into dev feat: quant_flash_attn and quant_flash_attn_metadata operators Created-by: weixin_44144262 Commit-by: lijinxi Merged-by: ascend-robot Description: # Which issue(s) this PR fixes or accomplishes > Fix part of #136 # Purpose 新增mxfp4的fa算子,配套的还有一个aicpu的metadata算子 # Test Plan 运行tests/ops/quant_flash_attn/quant_flash_attn_golden.py测试单算子精度 # Test Report  See merge request: Ascend/MindIE-SD!313 | 2 个月前 | |
[Feature][build]支持多 torch 版本 wheel 打包 Co-authored-by: guowenna1<guowenna1@huawei.com> # message auto-generated for no-merge-commit merge: !342 merge pypi into dev [Feature][build]支持多 torch 版本 wheel 打包 Created-by: guowenna1 Commit-by: guowenna1 Merged-by: ascend-robot Description: # Which issue(s) this PR fixes or accomplishes https://gitcode.com/Ascend/MindIE-SD/issues/180 # Purpose 本 PR 支持构建一个可适配多个 torch 版本的 MindIE-SD wheel 包,同时保留原有固定 torch 版本构建方式。 主要变更: - 新增 MINDIESD_WHEEL_MODE=multi_torch 打包模式。 - 默认仍保持原有固定 torch 版本构建方式不变。 - 运行时根据当前 torch.__version__ 自动选择对应的 libPTAExtensionOPS.so。 - 支持在同一个 wheel 中包含 torch 2.6、2.7、2.8、2.9、2.10 对应的 plugin 动态库。 - 新增 build/build_multi_torch_wheel.sh,用于从已准备好的 torch 容器中编译并收集多版本 plugin。 - 更新 package data 规则,支持打包 plugin/torchXX/*.so。 - 将 distribution 标记为二进制包,便于后续通过 auditwheel 修复为 PyPI 可接受的 manylinux wheel。 - 支持通过 ASCEND_OP_NAME 和 ASCEND_COMPUTE_UNIT 配置 Ascend ops 构建范围。 # Test Plan 可按以下方式验证: 1. 检查 Python 和 shell 语法: ``bash python3 -m py_compile setup.py mindiesd/layers/register_ops.py bash -n build/build_ops.sh bash -n build/build_multi_torch_wheel.sh 构建多 torch 版本 wheel: bash bash build/build_multi_torch_wheel.sh 检查 wheel 中是否包含多版本 plugin: bash python3 - <<'PY' import zipfile from pathlib import Path wheel = Path("dist/mindiesd-3.0.0-cp311-cp311-linux_aarch64.whl") with zipfile.ZipFile(wheel) as zf: libs = sorted(name for name in zf.namelist() if name.endswith("libPTAExtensionOPS.so")) print("\n".join(libs)) PY 修复为 PyPI 可接受的 manylinux wheel: bash python3 -m auditwheel repair \ --plat manylinux_2_34_aarch64 \ -w dist/repaired \ dist/mindiesd-3.0.0-cp311-cp311-linux_aarch64.whl 检查上传包元数据: bash python3 -m twine check dist/repaired/*.whl Test Report 已执行以下检查: bash python3 -m py_compile setup.py mindiesd/layers/register_ops.py bash -n build/build_ops.sh bash -n build/build_multi_torch_wheel.sh 结果:通过。 已在以下容器中验证 multi-torch wheel 构建流程: lala_torch26 lala_torch27 lala_torch28 lala_torch29 lala_torch210 生成的 wheel 包含以下 plugin: mindiesd/plugin/torch26/libPTAExtensionOPS.so mindiesd/plugin/torch27/libPTAExtensionOPS.so mindiesd/plugin/torch28/libPTAExtensionOPS.so mindiesd/plugin/torch29/libPTAExtensionOPS.so mindiesd/plugin/torch210/libPTAExtensionOPS.so PyPI 上传包检查: bash python3 -m twine check dist/repaired/mindiesd-3.0.0-cp311-cp311-manylinux_2_34_aarch64.whl 结果:通过。 补充说明: 1. **变更类别** 功能增强 / 构建与发布 2. **影响文件** setup.py、pyproject.toml、mindiesd/layers/register_ops.py、build/build_ops.sh、build/build_multi_torch_wheel.sh`、quant flash attention 相关 opdef 文件。 See merge request: Ascend/MindIE-SD!342 | 2 个月前 | |
[feature][ops]: add mxfp4 quant flash attention softmax variants Co-authored-by: lijinxi<lijinxi2@huawei.com> # message auto-generated for no-merge-commit merge: !347 merge dev into dev [feature][ops]: add mxfp4 quant flash attention softmax variants Created-by: weixin_44144262 Commit-by: lijinxi Merged-by: ascend-robot Description: # Which issue(s) this PR fixes or accomplishes [#136](https://gitcode.com/Ascend/MindIE-SD/issues/136) # Purpose 本 PR 更新 MXFP4 量化 Flash Attention 算子实现。 主要变更: - 更新 quant flash attention block cube/vector kernel 逻辑。 - 调整 kernel 公共定义和 VF helper 文件。 - 新增 MXFP4 softmax VF 变体,支持 qs128/kvs32 和 qs128/kvs256 布局。 - 更新 quant flash attention metadata AICPU 侧处理,适配新的算子路径。 本 PR 仅包含算子 C++/kernel 代码变更,不包含 Python 运行时代码和 UT 变更。 # Test Plan - 编译 quant flash attention 自定义算子。 - 执行 quant flash attention 算子 UT,覆盖 MXFP4 路径。 - 验证 qs128/kvs32、qs128/kvs256 布局下的 MXFP4 attention case。 # Test Report - GitCode 远端 hook 检查:每次提交均 PASSED。 - 执行本地编译和 UT。  See merge request: Ascend/MindIE-SD!347 | 2 个月前 |