已开启
[Bug]: Flex Attention cppwrapper fails in mask_out backward on v2.7.1 #4431
Xuan Peng创建于 20 天前
20 天前 添加了label:bug
20 天前 添加了label:triage-review;删除了label:bug
TorchNPU-Bot
20 天前 评论:
20 天前 评论:
issue待分派,添加triage-review标签


20 天前 添加了label:bug
20 天前 添加了label:bot-triaged;删除了label:triage-review
TorchNPU-Bot
20 天前 评论:
20 天前 评论:
检测到当前 issue 已关联 PR,自动添加标签:bot-triaged


问题描述
在
torch_npuv2.7.1 分支开启 Torch Inductorcpp_wrapper,运行带mask_out的 Flex Attention 动态 backward 场景时,C++ wrapper 无法完成代码生成与后续 kernel 启动。适用范围
torch_npuv2.7.1cpp_wrapper实际表现
动态 backward 的 call size 进入 PyTorch 2.7.1 Flex Attention backward template 后触发:
此外,Triton 编译元数据中的
workspace_size、lock_num和lock_init_val没有传递给 NPU C++ launcher;需要 workspace 或同步锁的 kernel 会收到空的workspace_addr/sync_block_lock。原因分析
SymbolicGridFn生成 grid 表达式。NPUCachingAutotuner未转发 runtime workspace/lock 元数据,CppWrapperNpu也未据此分配并初始化对应 buffer。期望结果
lock_init_val初始化锁。mask_out场景不再因SymbolicGridFn断言或空 runtime buffer 失败。验证情况
mask_out动态 backward +cpp_wrapper复现场景。