Pull Request已成功合入, 合并人@ascend-robot
(感谢 xuyun15 的贡献)变更摘要
本次 PR 修复了 multi_stream_lazy_reclaim 特性在大量积压事件(sum > kLazyQuerySize)场景下的 coredump 问题。根本原因是 process_events() 原本在 get_free_block() 之后调用:此时 get_free_block() 已从空闲池取出但尚未标记为已分配的块(allocated == false),若 process_events() 回收相邻块后触发 try_merge_blocks() 合并,会导致该未完成分配的块被合并删除,造成分配器数据结构损坏。修复方案将 sum > kLazyQuerySize 触发的 process_events() 移至 get_free_block() 之前执行,并通过 reaped 变量防止同一轮 malloc() 中 process_events() 被冗余调用两次。
主要改动
- 调整
process_events()调用时序:在NPUCachingAllocator.cpp的malloc()路径中,将sum > kLazyQuerySize时的process_events()从get_free_block()之后移至之前执行,确保在选块前完成事件回收,避免未完成分配的块被try_merge_blocks()误合并。 - 引入
reaped防重入守卫:新增bool reaped变量记录是否已调用过process_events();在!block_found且!reaped时才执行第二段process_events(),防止同一轮malloc()中重复调用。 - 新增回归测试用例:在
test_allocator_envs.py中添加test_multi_stream_lazy_reclaim_trigger_event,通过创建超过kLazyQuerySize(512)个带record_stream的张量后释放并重新分配,以子进程方式验证修复后不再发生崩溃。


代码审查
审查总结
审查覆盖的文件
| 文件 | 审查结果 |
|---|---|
torch_npu/csrc/core/npu/NPUCachingAllocator.cpp |
无问题 — 修复逻辑正确,将 process_events() 移至 get_free_block() 之前调用,并通过 reaped 标志避免同一轮 malloc() 中重复调用,消除了 use-after-free 风险。 |
test/npu/test_allocator_envs.py |
发现 1 个 P3 问题(测试可靠性) |
按优先级统计
- P0: 0
- P1: 0
- P2: 0
- P3: 1
整体风险评估
低风险。 C++ 修复正确地解决了 multi_stream_lazy_reclaim 在 block_found=true 且 sum > kLazyQuerySize 时因 process_events() 与 get_free_block() 时序不当导致的 use-after-free / coredump 问题。修复逻辑完备,覆盖了所有场景组合,reaped 标志设计合理。测试用例能够覆盖核心修复路径,唯一的改进点是使用 torch.npu.synchronize() 替代 time.sleep(0.1) 以提高测试确定性。
⚠️ 已识别出整体风险,但无法提取行内评论,请参考整体评估。


Thanks for your pull-request.
The full list of commands accepted by me can be found at here。
You can get sig-info at here
PR Approval Progress
✅ Congratulations! All modules have met the lgtm and approve requirements.
Module Approval Details
| module | lgtm status | approve status |
|---|---|---|
| repo-Ascend/pytorch | ✅ liujunzhu, htchu (2/2) | ✅ liujunzhu, htchu (2/1) |
| test | ✅ liujunzhu, htchu (2/2) | ✅ htchu, liujunzhu (2/1) |
💡 Tip:
- Committer can comment
/approveor/lgtm- Commenting
/approveimplies both code review (lgtm) and intent to merge (approve)
CLA Signature Pass
xuyun15, thanks for your pull request. All authors of the commits have signed the CLA. 👍


当前仓库存在以下 保护分支 :
| Protected Branch | Version | Release |
|---|---|---|
| master | ||
| v2.7.1 | ||
| v2.10.0 | ||
| v2.9.0 | ||
| v2.12.0 | ||
| v2.11.0 | ||
| v2.9.0-26.1.0 | ||
| v2.10.0-26.1.0 | ||
| v2.7.1-26.1.0 | ||
| v2.11.0-26.1.0 | ||
| v2.12.0-26.1.0 | ||
| ci-test |
评论 /sync <branch1> <branch2> ... 可将当前 PR 修改同步到其它分支(创建同步 PR):
a) 如果当前 PR 是 Open 状态,同步操作将延迟到 PR 被合并时执行
b) 如果当前 PR 已经 Merged,将立即执行同步操作
注意:
- /sync 命令可以指定同步到多个分支,仅最后一个 /sync 命令生效
- 如果创建的同步 PR 不正确,可通过向同步 PR 的源分支提交轻量级 PR 完善,或使用 /close 命令关闭


ascend docs pipeline is running...


✅ 跳过 docs ci 检查,没有需要检查的文档文件


| 阶段 | 任务名 | 状态 | 详情 |
|---|---|---|---|
| 编译构建 | Build_X86 | ✅ | >>> |
| Build_ARM | ✅ | >>> | |
| Build_LibTorch_x86 | ✅ | >>> | |
| Build_LibTorch_ARM | ✅ | >>> | |
| Build_X86_torchair | 🛑 | >>> | |
| Build_ARM_torchair | 🛑 | >>> | |
| patch_test | 🛑 | >>> | |
| 恶意代码检查 | Antipoison | ✅ | >>> |
| 编码安全与规范检查 | CodeCheck | ✅ | >>> |
| check_error | ✅ | >>> | |
| CodeCheck_lintrunner | ✅ | >>> | |
| 开源片段检查 | SCA | ✅ | >>> |
| 开发者测试 | UT_ARM_A3_Part_01 | ✅ | >>> |
| UT_ARM_A3_Part_02 | ✅ | >>> | |
| UT_ARM_A2_Part_01 | ✅ | >>> | |
| UT_ARM_A2_Part_02 | ✅ | >>> | |
| UT_ARM_A2_Part_03 | ✅ | >>> | |
| UT_inductor_Part_01 | 🛑 | >>> | |
| UT_inductor_Part_02 | 🛑 | >>> | |
| UT_inductor_Part_03 | 🛑 | >>> | |
| UT_inductor_Part_04 | 🛑 | >>> | |
| UT_DIST_ARM_Part_01 | 🛑 | >>> | |
| UT_DIST_ARM_Part_02 | 🛑 | >>> | |
| UT_DIST_ARM_Part_03 | 🛑 | >>> | |
| UT_DIST_ARM_Part_04 | 🛑 | >>> | |
| UT_ARM_A2_Select_Part_01 | ✅ | >>> | |
| UT_ARM_A2_Select_Part_02 | ✅ | >>> | |
| 流水线 | PR-pipeline_pytorch | ✅ | >>> |
- compile、compile_inductor、compile_torchair : 运行流水线
- retry : 重试流水线所有失败子任务
- retry <任务名> : 仅重试指定失败子任务
- stop : 停止流水线


/approve




【合入来源】
【修改方案】
选取issue中方案2作为解决方案
方案2:将 sum > kLazyQuerySize 的 process_events 移到 get_free_block 之前(推荐)
将
sum > kLazyQuerySize触发的process_events()移到get_free_block之前,保持与原生 PyTorch 相同的安全时序。同时引入reaped变量避免process_events()的冗余二次调用。2.1 process_events() 二次调用问题分析
方案2将
process_events()的调用拆分为两段:sum > kLazyQuerySize时在get_free_block之前调用!block_found时在get_free_block之后调用当
sum > kLazyQuerySize且get_free_block()仍然失败时,两段都会触发process_events(),导致同一轮malloc()中process_events()被调用两次。【资料变更】
不涉及:当前pr不涉及,但是后续会持续跟踪搜集用户诉求,逐步补齐对应的资料和用例
【接口变更】
不涉及
【功能验证】
修复前:


修复后:
【CheckList】