| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
fix llt Co-authored-by: zhangouli<zhangouli@h-partners.com> # message auto-generated for no-merge-commit merge: !5126 merge master into master fix llt Created-by: zhangouli Commit-by: zhangouli Merged-by: cann-robot Description: ## 描述 修复线上LLT失败问题。 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在这里提供Issue链接。例如:关联Issue #xxx--> ## 测试 <!--描述进行了哪些测试来验证你的改动。包括但不限于二级冒烟、算子泛化等。--> ## 文档更新 <!--如果这个PR包含文档的更新,请在这里指出。例如:更新了README.md文件。--> ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 fix: Bug 修复 - [ ] ✨ feat: 新功能 - [ ] ⚡ perf: 性能优化 - [ ] ♻️ refactor: 代码重构 - [ ] 🧪 test: 新增或修改测试 - [ ] 📝 docs: 文档更新 - [ ] 🔧 ci: CI/CD 配置修改 - [ ] ↩️ revert: 回退 - [ ] 🧹 chore: 其他,请具体描述 See merge request: cann/asc-devkit!5126 | 1 个月前 | |
fix: align pybind bisheng toolchain Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !4275 merge fix_pytorch_framework_cases_20260709 into master fix: align pybind bisheng toolchain Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 变更说明 - 对 pybind、torch_library、ge_torchair 和 torch_library_report_tensor 样例的 CMake toolchain 进行统一适配,从 CMake 选定的 C++ 编译器自动推导 GCC toolchain,并传递给 bisheng 编译和链接阶段。 - CMake 探测 Torch、torch_npu 和 pybind11 路径时临时关闭 SLOG 标准输出,避免运行日志污染路径变量。 - 保留 master 现有 scripts/run_presmoke.sh,新版编排能力继续通过 scripts/run_presmoke_v2.sh 验证,支持自动识别可见 NPU、多卡分片、固定调度、单 case/过滤列表执行、仅编译模式以及完整报告输出。 - 精简 presmoke v2 多卡执行:删除临时 workspace 复制及清理逻辑,多卡共享源码目录;scenario 使用独立构建目录并可跨卡分片,同时保留必要的自定义算子依赖约束。 - 调整自定义算子包依赖调度和 tiling sink 日志校验,减少不必要的全局锁与全局日志操作。 - 补齐两个新增 950 样例的 6 个 scenario runner、manifest 和固定调度顺序。 - 增加 910B 八卡固定分片清单及完整性校验,发现新增、遗漏或重复 case 时直接报错,避免固定顺序与实际 case 集合漂移。 - 优化多卡关键路径:保持自定义算子依赖链顺序,仅对 custom_op 算子包构建启用 16 路并行编译,其他 case 继续使用自动计算的并行度。 ## 验证 - 完成相关 PyTorch 样例的 clean build 和 NPU 运行验证。 - presmoke Shell 语法检查、分支级 pre-commit 检查和 138 个 Python 单元测试通过。 - 910B NPU 8 卡全量验证:共 301 个结果,299 PASS、0 FAIL、2 SKIP;删除 workspace 复制并允许 scenario 跨卡分片后,整体耗时 262 秒,NPU 利用率 87.073%。 - 910B 八卡调度实验确认固定分片覆盖 301 个 case;提高自定义算子依赖链的编译并行度后,关键路径进一步缩短。固定分片只提交 case 映射,历史耗时及运行报告不纳入仓库。 - 950 NPU 单卡全量验证:共 497 个结果,472 PASS、23 FAIL、2 SKIP;整体耗时 3487 秒,NPU 利用率约 99.98%。其中 18 个编译失败由当前 CANN 安装缺少 950 头文件引起,另有 5 个 bank_conflict_3510 场景精度校验失败。 See merge request: cann/asc-devkit!4275 | 2 个月前 | |
修复msProf、matrix_transpose脚本 Co-authored-by: cgcaof<git config --global user.email you@example.com> # message auto-generated for no-merge-commit merge: !4650 merge master into master 修复msProf、matrix_transpose脚本 Created-by: cgcaof Commit-by: cgcaof Merged-by: cann-robot Description: ## 描述 msProf、matrix_transpose的冒烟脚本存在错误,修复脚本 ## 关联的Issue 不涉及 ## 测试 tess pass! ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 fix: Bug 修复 - [ ] ✨ feat: 新功能 - [ ] ⚡ perf: 性能优化 - [ ] ♻️ refactor: 代码重构 - [ ] 🧪 test: 新增或修改测试 - [ ] 📝 docs: 文档更新 - [ ] 🔧 ci: CI/CD 配置修改 - [ ] ↩️ revert: 回退 - [ ] 🧹 chore: 其他,请具体描述 See merge request: cann/asc-devkit!4650 | 1 个月前 | |
fix: align pybind bisheng toolchain Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !4275 merge fix_pytorch_framework_cases_20260709 into master fix: align pybind bisheng toolchain Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 变更说明 - 对 pybind、torch_library、ge_torchair 和 torch_library_report_tensor 样例的 CMake toolchain 进行统一适配,从 CMake 选定的 C++ 编译器自动推导 GCC toolchain,并传递给 bisheng 编译和链接阶段。 - CMake 探测 Torch、torch_npu 和 pybind11 路径时临时关闭 SLOG 标准输出,避免运行日志污染路径变量。 - 保留 master 现有 scripts/run_presmoke.sh,新版编排能力继续通过 scripts/run_presmoke_v2.sh 验证,支持自动识别可见 NPU、多卡分片、固定调度、单 case/过滤列表执行、仅编译模式以及完整报告输出。 - 精简 presmoke v2 多卡执行:删除临时 workspace 复制及清理逻辑,多卡共享源码目录;scenario 使用独立构建目录并可跨卡分片,同时保留必要的自定义算子依赖约束。 - 调整自定义算子包依赖调度和 tiling sink 日志校验,减少不必要的全局锁与全局日志操作。 - 补齐两个新增 950 样例的 6 个 scenario runner、manifest 和固定调度顺序。 - 增加 910B 八卡固定分片清单及完整性校验,发现新增、遗漏或重复 case 时直接报错,避免固定顺序与实际 case 集合漂移。 - 优化多卡关键路径:保持自定义算子依赖链顺序,仅对 custom_op 算子包构建启用 16 路并行编译,其他 case 继续使用自动计算的并行度。 ## 验证 - 完成相关 PyTorch 样例的 clean build 和 NPU 运行验证。 - presmoke Shell 语法检查、分支级 pre-commit 检查和 138 个 Python 单元测试通过。 - 910B NPU 8 卡全量验证:共 301 个结果,299 PASS、0 FAIL、2 SKIP;删除 workspace 复制并允许 scenario 跨卡分片后,整体耗时 262 秒,NPU 利用率 87.073%。 - 910B 八卡调度实验确认固定分片覆盖 301 个 case;提高自定义算子依赖链的编译并行度后,关键路径进一步缩短。固定分片只提交 case 映射,历史耗时及运行报告不纳入仓库。 - 950 NPU 单卡全量验证:共 497 个结果,472 PASS、23 FAIL、2 SKIP;整体耗时 3487 秒,NPU 利用率约 99.98%。其中 18 个编译失败由当前 CANN 安装缺少 950 头文件引起,另有 5 个 bank_conflict_3510 场景精度校验失败。 See merge request: cann/asc-devkit!4275 | 2 个月前 | |
修复msProf、matrix_transpose脚本 Co-authored-by: cgcaof<git config --global user.email you@example.com> # message auto-generated for no-merge-commit merge: !4650 merge master into master 修复msProf、matrix_transpose脚本 Created-by: cgcaof Commit-by: cgcaof Merged-by: cann-robot Description: ## 描述 msProf、matrix_transpose的冒烟脚本存在错误,修复脚本 ## 关联的Issue 不涉及 ## 测试 tess pass! ## 文档更新 不涉及 ## 类型标签 <!-- [x] 表示选中 --> - [x] 🐛 fix: Bug 修复 - [ ] ✨ feat: 新功能 - [ ] ⚡ perf: 性能优化 - [ ] ♻️ refactor: 代码重构 - [ ] 🧪 test: 新增或修改测试 - [ ] 📝 docs: 文档更新 - [ ] 🔧 ci: CI/CD 配置修改 - [ ] ↩️ revert: 回退 - [ ] 🧹 chore: 其他,请具体描述 See merge request: cann/asc-devkit!4650 | 1 个月前 | |
Add presmoke runner and validation reports Co-authored-by: xun_zhuge<zhugexun@hisilicon.com> # message auto-generated for no-merge-commit merge: !2900 merge presmoke_opt into master Add presmoke runner and validation reports Created-by: xun_zhuge Commit-by: xun_zhuge Merged-by: cann-robot Description: ## 描述 本 PR 将 presmoke 看护入口收敛到 scripts/run_presmoke.sh,用于统一 910B/950 全量看护和单 case 调试,同时保留旧脚本调用方依赖的成功/失败输出约定。 主要变更: - scripts/run_presmoke.sh 作为统一入口,默认不带参数时仍按 910B NPU 模式执行。 - 成功时输出 execute samples success,失败时输出 execute samples failed 并返回非 0。 - 支持固定调度顺序,尽量降低 NPU 队列空闲时间。 - 全量运行前清理 CANN opp/vendors 下已安装自定义算子包,避免历史安装污染。 - 保留自定义算子依赖顺序:custom_op_static_lib、parallel_ops_package、custom_op 以及依赖 custom op 的 aclnn/aclop/onnx/tiling_sink 等 case 按依赖顺序执行。 - 报告统一输出到 presmoke_reports/,包含最终汇总、case timing、失败列表和 stage 日志。 - npu-smi info 仅作为元信息采集,增加短超时保护,避免收尾阶段卡住。 - CPU 模式改为显式 opt-in,可通过 MODES=cpu 或 MODE=cpu 启用。 ## 关联的Issue 无。 ## 测试 本地检查: bash bash -n scripts/run_presmoke.sh PYTHONPATH=scripts python3 -m unittest discover -s scripts/presmoke/tests -v git diff --check 910B 全量 NPU 看护验证: bash ARCH=dav-2201 MODES=npu PRIMARY_CARD=7 RETRY_CARDS="1 2 3 4 5 6" bash scripts/run_presmoke.sh 结果: - planned:170 - pass/fail/skip:168/0/2 - elapsed:667s - NPU busy/idle:665.697s / 0.893s - NPU utilization:99.9% - effective status:PASS 950 全量 NPU 看护验证: bash ARCH=dav-3510 MODES=npu PRIMARY_CARD=0 bash scripts/run_presmoke.sh 结果: - planned:249 - pass/fail/skip:244/3/2 - elapsed:1758s - NPU busy/idle:1757.458s / 0.812s - NPU utilization:接近 100% - effective status:FAIL 950 剩余 3 个失败均为 build 阶段编译失败,不是 NPU run timeout: - 03_simt_api/02_features/00_framework/00_pytorch/torch_library_roll - 03_simt_api/02_features/01_api_features/00_memory_access/insert_hash_table - 03_simt_api/03_best_practices/00_memory_optimizations/cache_hint 典型错误: - double precision operation is not allowed in aicore function - no matching function for call to 'max'/'min' ## 文档更新 更新 scripts/presmoke/README.md,补充: - 默认运行方式。 - 910B/950 看护参数示例。 - 单 case 调试方式。 - CPU 模式说明。 - 报告目录和日志说明。 - 运行全量时不要中途覆盖工作目录,避免污染 build/run 分阶段产物。 ## 类型标签 <!-- [x] 表示选中 --> - [ ] 🐛 fix: Bug 修复 - [x] ✨ feat: 新功能 - [x] ⚡ perf: 性能优化 - [x] ♻️ refactor: 代码重构 - [ ] 🧪 test: 新增或修改测试 - [x] 📝 docs: 文档更新 - [x] 🔧 ci: CI/CD 配置修改 - [ ] ↩️ revert: 回退 - [ ] 🧹 chore: 其他,请具体描述 See merge request: cann/asc-devkit!2900 | 3 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 1 个月前 | ||
| 2 个月前 | ||
| 1 个月前 | ||
| 2 个月前 | ||
| 1 个月前 | ||
| 3 个月前 |