| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
fix: align pybind bisheng toolchain Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !4275 merge fix_pytorch_framework_cases_20260709 into master fix: align pybind bisheng toolchain Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 变更说明 - 对 pybind、torch_library、ge_torchair 和 torch_library_report_tensor 样例的 CMake toolchain 进行统一适配,从 CMake 选定的 C++ 编译器自动推导 GCC toolchain,并传递给 bisheng 编译和链接阶段。 - CMake 探测 Torch、torch_npu 和 pybind11 路径时临时关闭 SLOG 标准输出,避免运行日志污染路径变量。 - 保留 master 现有 scripts/run_presmoke.sh,新版编排能力继续通过 scripts/run_presmoke_v2.sh 验证,支持自动识别可见 NPU、多卡分片、固定调度、单 case/过滤列表执行、仅编译模式以及完整报告输出。 - 精简 presmoke v2 多卡执行:删除临时 workspace 复制及清理逻辑,多卡共享源码目录;scenario 使用独立构建目录并可跨卡分片,同时保留必要的自定义算子依赖约束。 - 调整自定义算子包依赖调度和 tiling sink 日志校验,减少不必要的全局锁与全局日志操作。 - 补齐两个新增 950 样例的 6 个 scenario runner、manifest 和固定调度顺序。 - 增加 910B 八卡固定分片清单及完整性校验,发现新增、遗漏或重复 case 时直接报错,避免固定顺序与实际 case 集合漂移。 - 优化多卡关键路径:保持自定义算子依赖链顺序,仅对 custom_op 算子包构建启用 16 路并行编译,其他 case 继续使用自动计算的并行度。 ## 验证 - 完成相关 PyTorch 样例的 clean build 和 NPU 运行验证。 - presmoke Shell 语法检查、分支级 pre-commit 检查和 138 个 Python 单元测试通过。 - 910B NPU 8 卡全量验证:共 301 个结果,299 PASS、0 FAIL、2 SKIP;删除 workspace 复制并允许 scenario 跨卡分片后,整体耗时 262 秒,NPU 利用率 87.073%。 - 910B 八卡调度实验确认固定分片覆盖 301 个 case;提高自定义算子依赖链的编译并行度后,关键路径进一步缩短。固定分片只提交 case 映射,历史耗时及运行报告不纳入仓库。 - 950 NPU 单卡全量验证:共 497 个结果,472 PASS、23 FAIL、2 SKIP;整体耗时 3487 秒,NPU 利用率约 99.98%。其中 18 个编译失败由当前 CANN 安装缺少 950 头文件引起,另有 5 个 bank_conflict_3510 场景精度校验失败。 See merge request: cann/asc-devkit!4275 | 2 个月前 | |
fix: align pybind bisheng toolchain Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !4275 merge fix_pytorch_framework_cases_20260709 into master fix: align pybind bisheng toolchain Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 变更说明 - 对 pybind、torch_library、ge_torchair 和 torch_library_report_tensor 样例的 CMake toolchain 进行统一适配,从 CMake 选定的 C++ 编译器自动推导 GCC toolchain,并传递给 bisheng 编译和链接阶段。 - CMake 探测 Torch、torch_npu 和 pybind11 路径时临时关闭 SLOG 标准输出,避免运行日志污染路径变量。 - 保留 master 现有 scripts/run_presmoke.sh,新版编排能力继续通过 scripts/run_presmoke_v2.sh 验证,支持自动识别可见 NPU、多卡分片、固定调度、单 case/过滤列表执行、仅编译模式以及完整报告输出。 - 精简 presmoke v2 多卡执行:删除临时 workspace 复制及清理逻辑,多卡共享源码目录;scenario 使用独立构建目录并可跨卡分片,同时保留必要的自定义算子依赖约束。 - 调整自定义算子包依赖调度和 tiling sink 日志校验,减少不必要的全局锁与全局日志操作。 - 补齐两个新增 950 样例的 6 个 scenario runner、manifest 和固定调度顺序。 - 增加 910B 八卡固定分片清单及完整性校验,发现新增、遗漏或重复 case 时直接报错,避免固定顺序与实际 case 集合漂移。 - 优化多卡关键路径:保持自定义算子依赖链顺序,仅对 custom_op 算子包构建启用 16 路并行编译,其他 case 继续使用自动计算的并行度。 ## 验证 - 完成相关 PyTorch 样例的 clean build 和 NPU 运行验证。 - presmoke Shell 语法检查、分支级 pre-commit 检查和 138 个 Python 单元测试通过。 - 910B NPU 8 卡全量验证:共 301 个结果,299 PASS、0 FAIL、2 SKIP;删除 workspace 复制并允许 scenario 跨卡分片后,整体耗时 262 秒,NPU 利用率 87.073%。 - 910B 八卡调度实验确认固定分片覆盖 301 个 case;提高自定义算子依赖链的编译并行度后,关键路径进一步缩短。固定分片只提交 case 映射,历史耗时及运行报告不纳入仓库。 - 950 NPU 单卡全量验证:共 497 个结果,472 PASS、23 FAIL、2 SKIP;整体耗时 3487 秒,NPU 利用率约 99.98%。其中 18 个编译失败由当前 CANN 安装缺少 950 头文件引起,另有 5 个 bank_conflict_3510 场景精度校验失败。 See merge request: cann/asc-devkit!4275 | 2 个月前 | |
fix: align pybind bisheng toolchain Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !4275 merge fix_pytorch_framework_cases_20260709 into master fix: align pybind bisheng toolchain Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 变更说明 - 对 pybind、torch_library、ge_torchair 和 torch_library_report_tensor 样例的 CMake toolchain 进行统一适配,从 CMake 选定的 C++ 编译器自动推导 GCC toolchain,并传递给 bisheng 编译和链接阶段。 - CMake 探测 Torch、torch_npu 和 pybind11 路径时临时关闭 SLOG 标准输出,避免运行日志污染路径变量。 - 保留 master 现有 scripts/run_presmoke.sh,新版编排能力继续通过 scripts/run_presmoke_v2.sh 验证,支持自动识别可见 NPU、多卡分片、固定调度、单 case/过滤列表执行、仅编译模式以及完整报告输出。 - 精简 presmoke v2 多卡执行:删除临时 workspace 复制及清理逻辑,多卡共享源码目录;scenario 使用独立构建目录并可跨卡分片,同时保留必要的自定义算子依赖约束。 - 调整自定义算子包依赖调度和 tiling sink 日志校验,减少不必要的全局锁与全局日志操作。 - 补齐两个新增 950 样例的 6 个 scenario runner、manifest 和固定调度顺序。 - 增加 910B 八卡固定分片清单及完整性校验,发现新增、遗漏或重复 case 时直接报错,避免固定顺序与实际 case 集合漂移。 - 优化多卡关键路径:保持自定义算子依赖链顺序,仅对 custom_op 算子包构建启用 16 路并行编译,其他 case 继续使用自动计算的并行度。 ## 验证 - 完成相关 PyTorch 样例的 clean build 和 NPU 运行验证。 - presmoke Shell 语法检查、分支级 pre-commit 检查和 138 个 Python 单元测试通过。 - 910B NPU 8 卡全量验证:共 301 个结果,299 PASS、0 FAIL、2 SKIP;删除 workspace 复制并允许 scenario 跨卡分片后,整体耗时 262 秒,NPU 利用率 87.073%。 - 910B 八卡调度实验确认固定分片覆盖 301 个 case;提高自定义算子依赖链的编译并行度后,关键路径进一步缩短。固定分片只提交 case 映射,历史耗时及运行报告不纳入仓库。 - 950 NPU 单卡全量验证:共 497 个结果,472 PASS、23 FAIL、2 SKIP;整体耗时 3487 秒,NPU 利用率约 99.98%。其中 18 个编译失败由当前 CANN 安装缺少 950 头文件引起,另有 5 个 bank_conflict_3510 场景精度校验失败。 See merge request: cann/asc-devkit!4275 | 2 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 2 个月前 | ||
| 2 个月前 | ||
| 2 个月前 |