已开启
【master】迁移 PR 45524:修复 NPU Triton mask 与 f64 代码生成 #4607
Xuan Peng创建于 3 天前
3 天前 添加了label:triage-review
TorchNPU-Bot
3 天前 评论:
3 天前 评论:
issue待分派,添加triage-review标签


3 天前 添加了label:bot-triaged;删除了label:triage-review
TorchNPU-Bot
3 天前 评论:
3 天前 评论:
检测到当前 issue 已关联 PR,自动添加标签:bot-triaged


背景
原 PR 45524 已在
v2.10.0分支合入。本 issue 用于跟踪将同一修复迁移到master分支,避免主线继续暴露相同的 NPU Inductor Triton 代码生成问题。原问题单:4437
问题描述
NPU Inductor Triton 后端在静态和动态
std(dim=1)场景中存在两类代码生成风险:tl.float64。Triton-Ascend 对应的向量运算无法合法编译,导致动态路径编译失败。迁移范围与验收标准
NPUTritonKernel在非固定 autotune 配置下保留尾块 mask,固定配置继续使用上游优化。tl.float64输出为tl.float32,不改变社区TritonKernel或其他后端行为。std(dim=1)能够在master分支正确生成并编译 NPU Triton kernel。迁移提交:
7515965ab9cf20f5cdab70fde7f60fcb732700f7(分支HinPeng:port/pr-45524-master)。当前验证
git diff --check、Python AST 解析和python3 -m py_compile。torch_npu._C,本次未重新执行 NPU 实机编译/运行;原 PR 已在 Ascend_910B 环境完成对应验证。