| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
fix: fix cann version judge Co-authored-by: y30062407<handsome0324@163.com> # message auto-generated for no-merge-commit merge: !39252 merge master_fix into master fix: fix cann version judge Created-by: yangch0324 Commit-by: y30062407 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 版本是 string,但不是直接字符串比较。GetCANNInfo.cpp 里有 VersionToNum 和 VersionV2ToNum 两个函数,把版本号转成整数再比较。 核心代码 GetCANNInfo.cpp:488-556: IsGteCANNVersion("9.1.0") → VersionV2ToNum("当前版本") → 9 * 10000000 + 1 * 100000 + 0 * 1000 = 90100000 → VersionV2ToNum("9.1.0") → 90100000 → current_num >= boundary_num → True/False 公式(line 323): major * 10000000 + minor * 100000 + patch * 1000 - weight + prerelease 9.1.0 = 90100000,9.0.0 = 90000000,9.2.RC1 ≈ 90199900。数字比较完全可靠。 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!39252 | 2 个月前 | |
[master][bugfix]cann and pta header mixing bulid bugfix Co-authored-by: Dring<17737727613@163.com> # message auto-generated for no-merge-commit merge: !44990 merge master into master [master][bugfix]cann and pta header mixing bulid bugfix Created-by: Dring Commit-by: Dring Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/3991 - [✕ ] 需求 - [ ✓] 问题单 - [ ✓] issue/工单 - [ ✓] 重构优化 - [✕ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) 问题现象: PTA 26.1.0 仓库中的 third_party/acl 头文件来自 CANN 9.1.0,而编译环境安装的是 CANN 9.0.0。当同一个编译单元同时包含两套版本的 ACL 头文件时,会出现类似以下错误:aclmdlRITask 未声明、未定义或类型不匹配 aclmdlRITask 是 CANN 9.1.0 头文件所依赖的定义,但 CANN 9.0.0 对应头文件中不存在该定义或定义不兼容。 根因分析: 1 当前头文件查找路径不统一:PTA 源码中大量使用以下写法 #include "third_party/acl/inc/acl/acl_mdl.h" 因为编译命令中包含 PTA 项目根目录,这种写法会直接命中 PTA 26.1.0 仓库内由 CANN 9.1.0 导入的头文件:torch_npu/third_party/acl/inc/acl/acl_mdl.h 但该头文件内部使用的是标准 SDK 相对路径:#include "acl/acl_base.h" 编译器无法相对 acl_mdl.h 所在目录找到 acl/acl_base.h,因此转而按照全部 -I 目录依次搜索。如果 CANN 9.0.0 的 include 路径排在 PTA 内置 ACL 路径前面,就会命中:CANN-9.0.0/include/acl/acl_base.h 同一个翻译单元最终形成: acl_mdl.h -> PTA third_party 中的 CANN 9.1.0 版本 acl_base.h -> 环境 CANN 9.0.0 版本 这是一种“首层头文件由源码路径固定版本、传递头文件由 -I 顺序选择版本”的混合查找模式。 2 问题不局限于 acl_mdl.h 同样风险存在于所有能够继续 include 其他 CANN 头文件的入口,包括: acl/... aml/... profiling/... graph/... ge/... op_proto/... 因此不能只修复出现错误的某一个头文件,也不能只替换 acl_mdl.h。必须统一整个 CANN 头文件族的查找规则。 修改目标: 修改后需要满足 源码不再包含 third_party/acl/inc/... 这种仓库物理路径。 ACL、AML、profiling 等头文件全部通过统一 include root 查找。 一个编译 target 对 CANN 头文件只选择一套版本。 CANN 9.0.0 环境构建时,首层和传递头文件必须全部命中 CANN 9.0.0。 使用 PTA 内置头文件构建时,首层和传递头文件必须全部命中 PTA 内置的同一套版本。 wheel、libtorch_npu、C++ Extension 和 Inductor/AOT 使用同一目录契约 修改方案: 1、代码中使用 PTA 内置 ACL 头文件的地方,删除 third_party/acl/inc/ 物理路径前缀,统一改成从 include root 查找 2、打包或安装时,把 third_party/acl/inc 下需要公开的目录按原相对结构复制到安装产物的公共 include 根目录 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 cann 9.0.0 + pta 26.1.0的vllm-ascend安装验证成功  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [✓ ] 代码注释完备,正确记录错误日志 - [✕ ] 代码实现进行了返回值、空指针等校验 - [✓ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [✓ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!44990 | 7 天前 | |
update MIN_SUPPORTED to 2.13 Co-authored-by: huangyunlong2022<huangyunlong4@h-partners.com> # message auto-generated for no-merge-commit merge: !45447 merge 2.13one into master update MIN_SUPPORTED to 2.13 Created-by: huangyunlong2022 Commit-by: huangyunlong2022 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) master分支最小支持的torch版本升级到2.13,对应更新python和c++侧_compat目录中对2.12及以下版本的兼容,同步更新对应使用的地方 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45447 | 2 天前 | |
[inductor][docs]update on inductor docs Co-authored-by: jimmycao9929<caohaijun3@huawei.com> # message auto-generated for no-merge-commit merge: !45550 merge master-doc-update into master [inductor][docs]update on inductor docs Created-by: jimmycao9929 Commit-by: jimmycao9929 Merged-by: ascend-robot Description: fix: #4283 # 【合入来源】 - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [x] 资料更新 # 【修改方案】 资料更新:inductor架构图 增加资料:split core / limit core # 【资料变更】 资料更新:inductor架构图 增加资料:split core / limit core # 【接口变更】 不涉及 # 【功能验证】 不涉及 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45550 | 3 天前 | |
fix gelu inductor decomp to match eager Gelu/GeluV2 and add erf decomp for fusion Co-authored-by: wangzili<wangzili14@huawei.com> # message auto-generated for no-merge-commit merge: !43650 merge fix/gelu-decomp-eager-align-master into master fix gelu inductor decomp to match eager Gelu/GeluV2 and add erf decomp for fusion Created-by: wangzili121 Commit-by: wangzili Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 背景:hf_bert_large 精度不通过问题定位到 gelu 分解 1. Inductor gelu/gelu_backward 分解对齐 eager:按 TORCH_NPU_USE_COMPATIBLE_IMPL 走 Gelu(tanh) / GeluV2(erf|tanh) 2. tanh 分解为 exp/div 等基础算子 3. erf 按 AscendC PADE 拆成 clamp_max/min + 多项式 P/Q 等基础算子,便于融合 4. 低精度先升 fp32 计算再降回; # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 运行多张网络验证,精度正常,output_code中 erf 算子不再出现,小算子已参与融合 # 【CheckList】 - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43650 | 16 天前 | |
perf(inductor): finalize planned NPU fast launch submission Co-authored-by: erwin<j18636938310@163.com> # message auto-generated for no-merge-commit merge: !45508 merge p1-ab-master into master perf(inductor): finalize planned NPU fast launch submission Created-by: jiabiao_o Commit-by: erwin Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 1. Fast Launch 在进入 SubmitLaunch() 时已经准备好: - kernel handle; - packed arguments; - Block Num; - stream; - SIMT Dynamic UBUF 配置。 因此将通用opcommand入口改为OpCommand::RunOpApiV2(plan.kernelName, launchCall);复用仓库已有的 callable 入队接口,避免为每次 planned hit 构造通用 OpCommand、导出 ExecuteParas 和创建 COMPILE_AND_EXECUTE payload。 2. plan promotion 成功后,将 generated wrapper 的 call slot 从: BoundFastLaunch 替换为: FinalizedFastLaunch 稳态调用不再重复经过: BoundFastLaunch.__call__ _call_direct _canonical_args _build_runtime_launch_args # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 free time实测收益如下: base:13.974 ms fastlaunch:11.574 ms (收益:2.4 ms) fastlaunch优化后:19.814 ms (收益:3.16ms 增量0.76 ms) # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 # 【issues】 https://gitcode.com/Ascend/pytorch/issues/4345 See merge request: Ascend/pytorch!45508 | 6 天前 | |
feat(inductor): partition FA v3 TND+dropout via inductor pattern matcher Co-authored-by: luochao60<luochao60@huawei.com> # message auto-generated for no-merge-commit merge: !35040 merge Pta_add_fav3_pass_20260428_master into master feat(inductor): partition FA v3 TND+dropout via inductor pattern matcher Created-by: luochao60 Commit-by: luochao60 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > (如有)请关联需求文档/issue链接 > 关联 issue: #2010 (https://gitcode.com/Ascend/pytorch/issues/2010) - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列 > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) 将 FA v3( npu_fusion_attention_v3 / npu_fusion_attention_grad_v3)在 TND 布局 + dropout (keep_prob < 1) 场景下"不可被 ACLgraph 捕获"的处理路径,由 monkey-patch inductor 内部 _fx_node_is_input_dependent_cudagraph_unsafe 的方案,重构为基于 inductor PatternMatcherPass + POST_GRAD_PATTERNS 的合入方式。 1. 新增 torch_npu/_inductor/fx_passes/_proxy_ops.py: - 通过 torch.library.Library("npu", "FRAGMENT") 克隆原算子 schema,注册 npu_fusion_attention_v3_unsafe / npu_fusion_attention_grad_v3_unsafe 两个代理算子,并在 schema 上挂 torch._C.Tag.cudagraph_unsafe。 - 代理算子的 CompositeExplicitAutograd 实现与 register_fake 实现都直接转发到原算子(FA v3 的输入混合 NPU q/k/v 与 CPU actual_seq_qlen/kvlen,复用原算子的 device-propagation 规则)。 - 暴露 PROXY_TARGETS: dict[OpOverload, OpOverload] 供 pass 使用。 2. 新增 torch_npu/_inductor/fx_passes/fav3_partition_pass.py: - 用 PatternMatcherPass(pass_name="fav3_partition") 注册 forward / backward 两条 CallFunctionVarArgs(target) 规则。 - extra_check 中通过 torch.fx.operator_schemas.normalize_function 拿到归一化 kwargs,仅在 input_layout == "TND" 且 keep_prob < 1 时命中;同时在 inductor_config.triton.cudagraphs 关闭时直接 short-circuit,避免无意义的 dispatcher 跳转。 - handler 仅做 node.target = proxy,不引入新的 fx 节点;scheduler 之后会按 cudagraph_unsafe tag 把这些节点切出 captured graph 走 eager。 - register_fav3_partition_pass() 在 __init__.py 中调用一次:将 PMP 挂到 POST_GRAD_PATTERNS["fav3_partition"],并 setdefault 写入 post_grad_fusion_options。 3. 调整 torch_npu/_inductor/__init__.py: - 移除对已废弃的 patch_fx_node_is_input_dependent_cudagraph_unsafe 的导入与调用。 - 新增 register_fav3_partition_pass() 调用,与 register_fa_pass() 等其他 inductor 扩展挂载点放在一起。 4. 清理 torch_npu/_inductor/utils.py: - 删除 _fx_node_is_input_dependent_cudagraph_unsafe 与 patch_fx_node_is_input_dependent_cudagraph_unsafe(旧 monkey-patch 实现),逻辑已由新 pass 覆盖。 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写"不涉及" 不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写"不涉及" 不涉及。新增的 npu::npu_fusion_attention_v3_unsafe / npu::npu_fusion_attention_grad_v3_unsafe 仅作为 inductor 图改写的内部代理算子,行为完全转发至原 FA v3 算子,不对外暴露给用户脚本调用;patch_fx_node_is_input_dependent_cudagraph_unsafe 是 inductor 内部的 monkey-patch 入口,非客户面接口。 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤 > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 新增 UT:test/_inductor/test_fav3_partition_pass.py(225 行)覆盖以下场景: - TND + dropout 场景下 FA v3 fwd/bwd 节点的 target 被正确改写为代理算子。 - BSND/BSH 等其他 layout、keep_prob == 1.0 等不命中场景保持原 target 不变。 - 代理算子转发到原算子的数值一致性验证。 - inductor_config.triton.cudagraphs 关闭时 pass 不生效的 short-circuit 行为。 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!35040 | 4 天前 | |
[flexattention]: sync 2.7.1 bugfix to master Co-authored-by: ascend-robot<zhongyuanke@huawei.com> Co-authored-by: Stonexx<sheny1xuan@163.com> # message auto-generated for no-merge-commit merge: !45609 merge sync_master into master add flexattention score_mod support zeros_and_scatter op Created-by: stonexxx Commit-by: ascend-robot;Stonexx Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> https://gitcode.com/Ascend/pytorch/issues/4496 # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45609 | 3 天前 | |
fix: skip unsupported NPU coordinate descent tuning Co-authored-by: a_knight<498114223@qq.com> # message auto-generated for no-merge-commit merge: !45611 merge master into master fix: skip unsupported NPU coordinate descent tuning Created-by: a_knight Commit-by: a_knight Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/4495 - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45611 | 3 天前 | |
adapt pytorch2.13 for_inductor Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !41858 merge pta_master0714 into master adapt pytorch2.13 for_inductor Created-by: TonyYA Commit-by: TonyYA;zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/3056 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、本次修改将2.10的inductor代码(截至7.11最后一笔)同步到master(2.13)分支 2、针对社区接口变动及参数调整做适配修改 3、整体架构保持与2.10 inductor一致,未做架构级别重构调整 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 端到端模型验证表格 https://onebox.huawei.com/v/6d6647cf5de9b3f8a5118370ddb7a875?type=1&sheet=master%E5%88%86%E6%94%AF%E6%A8%A1%E5%9E%8B%E6%B5%8B%E8%AF%95 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41858 | 1 个月前 | |
fix(inductor): triton_experimental UT fixes + promoted rtree shape alignment Co-authored-by: slguo<guoshuailei1@huawei.com> # message auto-generated for no-merge-commit merge: !45171 merge fix_te_promoted_rtree_shape into master fix(inductor): triton_experimental UT fixes + promoted rtree shape alignment Created-by: slguo Commit-by: slguo Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单:https://gitcode.com/Ascend/pytorch/issues/4368 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 ### promoted rtree 形状对齐修复 promoted rtree flat-loop 重写把归约 mask 升级为全槽位块形状,但 (a) 被 mask 的 load 指针在索引只覆盖部分自由 r-node 时仍为条形;(b) store 偏移仍停留在提升前 rank——两者均依赖上游 Triton宽容、triton-ascend 拒绝的隐式 ptr-vs-mask 广播(NoTritonConfigsError: Cannot broadcast ...)。所有 2+ r-node 广播归约在编译期命中**;图带存活 x 轴(如 layernorm backward)时触发变体。 - **load**:索引张量显式 tl.broadcast_to 到逐槽位块形状(非 r 槽位取 real_sizes[s] 真实保持轴块宽——存活 x 轴得 XBLOCK 而非 1); - **store**:偏移 tl.full rank 前缀改写为 [1]*real_ndim,broadcast_to 目标逐槽位对齐(r 槽 1、保持槽真实块宽),与 value 侧塌缩镜像。 ## 1. 修复前的故障现场 ### 1.1 load 侧:ptr 与 mask 形状不齐 重写后 kernel 的 load 段(3×3 等价形式): python r0_1 = tl.arange(0, 3)[:, None, None] # [3,1,1] 行索引 r0_0 = tl.arange(0, 3)[None, :, None] # [1,3,1] 列索引 tmp1 = tl.load(y + (r0_0), (r0_1mask & r0_0mask), other=0.0) - 组合掩码 (r0_1mask & r0_0mask) 逐格相与,广播为 [3,3,1]; - 指针的索引项 r0_0 只携带列轴,停留在 [1,3,1]。 即 tl.load(ptr[1,3,1], mask[3,3,1]):掩码为 3×3 每格发放守卫位,而地址表只有第一行。 上游 Triton 以隐式广播容纳该写法;triton-ascend 拒绝: ValueError: Cannot broadcast ... [3,3,1] vs [1,3,1] → 全部候选 config 编译失败 → NoTritonConfigsError → test_cauchy(_dynamic_shapes) FAIL ### 1.2 store 侧:偏移 rank 滞后(large_broadcast_reduction 类图) python tl.store(out_ptr0 + tl.full([1, 1], 0, tl.int32).broadcast_to(XBLOCK, 1), tmp4, None) - value tmp4:promoted 重写经 tl.sum + resize 升至 rank-3 [1,1,1]; - offset:tl.full([1,1], 0, dt).broadcast_to(XBLOCK, 1) 是上游在 flat 单轴时代发射的 标准偏移形态,rank-2。重写对循环体按 token 匹配改造,该表达式不含任何被匹配的名字 (长在循环外、由 tl.full 与数字常量构成),因此未被升级。 ValueError: rank mismatch: [1, 1, 1], [1, 1] # 【资料变更】 > 不涉及 # 【接口变更】 > 不涉及 # 【功能验证】  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45171 | 2 天前 | |
[flexattention]: sync 2.7.1 bugfix to master Co-authored-by: ascend-robot<zhongyuanke@huawei.com> Co-authored-by: Stonexx<sheny1xuan@163.com> # message auto-generated for no-merge-commit merge: !45609 merge sync_master into master add flexattention score_mod support zeros_and_scatter op Created-by: stonexxx Commit-by: ascend-robot;Stonexx Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> https://gitcode.com/Ascend/pytorch/issues/4496 # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45609 | 3 天前 | |
support_list_for_register_meta_npu Co-authored-by: cuiduo<cuiduo1@huawei.com> # message auto-generated for no-merge-commit merge: !39251 merge master into master support_list_for_register_meta_npu Created-by: cuiduo Commit-by: cuiduo Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 删除patch,功能已实现 > 为sort函数注册新的meta,解决stride不一致的问题 # 【资料变更】 > 不涉及 # 【接口变更】 > 不涉及 # 【功能验证】 > 已补充UT # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!39251 | 2 个月前 | |
adapt pytorch2.13 for_inductor Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !41858 merge pta_master0714 into master adapt pytorch2.13 for_inductor Created-by: TonyYA Commit-by: TonyYA;zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/3056 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、本次修改将2.10的inductor代码(截至7.11最后一笔)同步到master(2.13)分支 2、针对社区接口变动及参数调整做适配修改 3、整体架构保持与2.10 inductor一致,未做架构级别重构调整 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 端到端模型验证表格 https://onebox.huawei.com/v/6d6647cf5de9b3f8a5118370ddb7a875?type=1&sheet=master%E5%88%86%E6%94%AF%E6%A8%A1%E5%9E%8B%E6%B5%8B%E8%AF%95 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41858 | 1 个月前 | |
catlass adapt 2.13.0 Co-authored-by: shi-bibibi99<shiyufeng8@huawei.com> # message auto-generated for no-merge-commit merge: !43293 merge 0729_master_catlass_branch1 into master catlass adapt 2.13.0 Created-by: shi-yufeng99 Commit-by: shi-bibibi99 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 在2.13.0中适配catlass,如下两个点需要适配: 1. v2.13 社区重构了 SizeVarAllocator,将 size_hint 重命名为 optimization_hint。本次PR将涉及到的size_hint代码都改为了optimization_hint 2. v2.13 上游将 benchmarker 从 TritonBenchmarker 改为 InductorBenchmarker。InductorBenchmarker.benchmark_gpu() 内部通过 is_gpu() 判断设备类型,而 GPU_TYPES 不含 "npu",导致回退到 "cuda",最终调用 torch.cuda.synchronize() 报 AssertionError: Torch not compiled with CUDA enabled。v2.10 用的是 TritonBenchmarker,委托给 triton 的 do_bench,triton 内部能正确识别 NPU driver,所以不受影响。 所以本次修改对ExternKernelGPUBenchmarkRequest做了基类的替换 [#3463](https://gitcode.com/Ascend/pytorch/issues/3463) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43293 | 1 个月前 | |
adapt pytorch2.13 for_inductor Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !41858 merge pta_master0714 into master adapt pytorch2.13 for_inductor Created-by: TonyYA Commit-by: TonyYA;zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/3056 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、本次修改将2.10的inductor代码(截至7.11最后一笔)同步到master(2.13)分支 2、针对社区接口变动及参数调整做适配修改 3、整体架构保持与2.10 inductor一致,未做架构级别重构调整 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 端到端模型验证表格 https://onebox.huawei.com/v/6d6647cf5de9b3f8a5118370ddb7a875?type=1&sheet=master%E5%88%86%E6%94%AF%E6%A8%A1%E5%9E%8B%E6%B5%8B%E8%AF%95 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41858 | 1 个月前 | |
add white list for 2.13 Co-authored-by: TonyYA<pangjiayi@huawei.com> # message auto-generated for no-merge-commit merge: !45391 merge master_ci_0827 into master add white list for 2.13 Created-by: TonyYA Commit-by: TonyYA Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 issue #4455 - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45391 | 4 天前 | |
[master][bugfix]cann and pta header mixing bulid bugfix Co-authored-by: Dring<17737727613@163.com> # message auto-generated for no-merge-commit merge: !44990 merge master into master [master][bugfix]cann and pta header mixing bulid bugfix Created-by: Dring Commit-by: Dring Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/3991 - [✕ ] 需求 - [ ✓] 问题单 - [ ✓] issue/工单 - [ ✓] 重构优化 - [✕ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) 问题现象: PTA 26.1.0 仓库中的 third_party/acl 头文件来自 CANN 9.1.0,而编译环境安装的是 CANN 9.0.0。当同一个编译单元同时包含两套版本的 ACL 头文件时,会出现类似以下错误:aclmdlRITask 未声明、未定义或类型不匹配 aclmdlRITask 是 CANN 9.1.0 头文件所依赖的定义,但 CANN 9.0.0 对应头文件中不存在该定义或定义不兼容。 根因分析: 1 当前头文件查找路径不统一:PTA 源码中大量使用以下写法 #include "third_party/acl/inc/acl/acl_mdl.h" 因为编译命令中包含 PTA 项目根目录,这种写法会直接命中 PTA 26.1.0 仓库内由 CANN 9.1.0 导入的头文件:torch_npu/third_party/acl/inc/acl/acl_mdl.h 但该头文件内部使用的是标准 SDK 相对路径:#include "acl/acl_base.h" 编译器无法相对 acl_mdl.h 所在目录找到 acl/acl_base.h,因此转而按照全部 -I 目录依次搜索。如果 CANN 9.0.0 的 include 路径排在 PTA 内置 ACL 路径前面,就会命中:CANN-9.0.0/include/acl/acl_base.h 同一个翻译单元最终形成: acl_mdl.h -> PTA third_party 中的 CANN 9.1.0 版本 acl_base.h -> 环境 CANN 9.0.0 版本 这是一种“首层头文件由源码路径固定版本、传递头文件由 -I 顺序选择版本”的混合查找模式。 2 问题不局限于 acl_mdl.h 同样风险存在于所有能够继续 include 其他 CANN 头文件的入口,包括: acl/... aml/... profiling/... graph/... ge/... op_proto/... 因此不能只修复出现错误的某一个头文件,也不能只替换 acl_mdl.h。必须统一整个 CANN 头文件族的查找规则。 修改目标: 修改后需要满足 源码不再包含 third_party/acl/inc/... 这种仓库物理路径。 ACL、AML、profiling 等头文件全部通过统一 include root 查找。 一个编译 target 对 CANN 头文件只选择一套版本。 CANN 9.0.0 环境构建时,首层和传递头文件必须全部命中 CANN 9.0.0。 使用 PTA 内置头文件构建时,首层和传递头文件必须全部命中 PTA 内置的同一套版本。 wheel、libtorch_npu、C++ Extension 和 Inductor/AOT 使用同一目录契约 修改方案: 1、代码中使用 PTA 内置 ACL 头文件的地方,删除 third_party/acl/inc/ 物理路径前缀,统一改成从 include root 查找 2、打包或安装时,把 third_party/acl/inc 下需要公开的目录按原相对结构复制到安装产物的公共 include 根目录 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 cann 9.0.0 + pta 26.1.0的vllm-ascend安装验证成功  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [✓ ] 代码注释完备,正确记录错误日志 - [✕ ] 代码实现进行了返回值、空指针等校验 - [✓ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [✓ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!44990 | 7 天前 | |
perf(inductor): optimize training operators Co-authored-by: luqichao<luqichao1@huawei.com> # message auto-generated for no-merge-commit merge: !45392 merge perf/inductor_train_opt_master into master perf(inductor): optimize training operators Created-by: luqichao Commit-by: luqichao Merged-by: ascend-robot Description: 1. 将 aten.embedding_dense_backward.default 加入 NPU native fallback,复用 NPU 原生算子,避免 Inductor 生成低效 kernel。 2. 在 Triton backend 中独立维护完整的 matmul_backward decomposition,覆盖不同输入维度和 batch 场景,降低对 MFusion backend 逻辑的依赖。 See merge request: Ascend/pytorch!45392 | 7 天前 | |
[feat] deterministic_level: add graph-mode guard and EX scope API Co-authored-by: ChengLyric<licheng236@huawei.com> # message auto-generated for no-merge-commit merge: !41762 merge feature/deterministic-level-graph-mode into master [feat] deterministic_level: add graph-mode guard and EX scope API Created-by: Guanam2020 Commit-by: ChengLyric Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、新增 torch_npu.dynamo._deterministic_guard.install_npu_deterministic_level_guard()。在 Dynamo 的 TracingContext.guards_context.dynamo_guards 中注册 Lambda Guard。 2、新增 torch_npu._inductor.deterministic_cache,在 AscendC 编译 scope 内 patch。 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 自验证ok # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41762 | 1 个月前 | |
[Inductor] improve aot_load patch Co-authored-by: zhuceHW<zhuce@huawei.com> # message auto-generated for no-merge-commit merge: !45240 merge main-0720 into master [Inductor] improve aot_load patch Created-by: zhucehw Commit-by: zhuceHW Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/4097?ref=&did=4257078#tid-4257078 - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 1. improve aot_load patch 2. add doc for aot_compile and aot_load # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 CI PASS # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45240 | 9 天前 | |
flexattention: port flexattention template to 2.13 Co-authored-by: Stonexx<sheny1xuan@163.com> # message auto-generated for no-merge-commit merge: !44356 merge fa_213_origin into master flexattention: port flexattention template to 2.13 Created-by: stonexxx Commit-by: Stonexx Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font>https://gitcode.com/Ascend/pytorch/issues/2571 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!44356 | 23 天前 | |
adapt pytorch2.13 for_inductor Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !41858 merge pta_master0714 into master adapt pytorch2.13 for_inductor Created-by: TonyYA Commit-by: TonyYA;zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/3056 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、本次修改将2.10的inductor代码(截至7.11最后一笔)同步到master(2.13)分支 2、针对社区接口变动及参数调整做适配修改 3、整体架构保持与2.10 inductor一致,未做架构级别重构调整 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 端到端模型验证表格 https://onebox.huawei.com/v/6d6647cf5de9b3f8a5118370ddb7a875?type=1&sheet=master%E5%88%86%E6%94%AF%E6%A8%A1%E5%9E%8B%E6%B5%8B%E8%AF%95 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41858 | 1 个月前 | |
[sync]Symbolic dynamic-shape grouping for reductions Co-authored-by: zhoujinning<zhoujinning2@huawei.com> # message auto-generated for no-merge-commit merge: !43088 merge master into master [sync]Symbolic dynamic-shape grouping for reductions Created-by: zhoujinning Commit-by: zhoujinning Merged-by: ascend-robot Description: [#3428](https://gitcode.com/Ascend/pytorch/issues/3428) <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43088 | 1 个月前 | |
[inductor]layernorm fix welford_reduce issue Co-authored-by: rain-666<chenxiaoyu12@huawei.com> # message auto-generated for no-merge-commit merge: !45429 merge master_layernorm_0827 into master [inductor]layernorm fix welford_reduce issue Created-by: rain-666 Commit-by: rain-666 Merged-by: ascend-robot Description: 本 PR 修复了 torch_npu Inductor 后端中 LayerNorm 使用 welford_reduce 时(尤其是 Ascend 950 上)SIMD 归约代码生成错误的问题。核心改动位于 torch_npu/_inductor/codegen/triton.py:新增 Welford 累加器(_acc_sum/_acc_sum_sq/_acc_count)的 tl.zeros 初始化逻辑,并按"向量化外层轴"与"标量外层轴"区分生成归约循环,避免多行数据在各自 tile 内相互累加;同时将持久化归约判定扩展为支持 A5 上归约长度 ≤ 8192 的 welford_reduce。此外新增默认关闭的 enable_layernorm_v4 开关(环境变量 TORCHINDUCTOR_ENABLE_LAYERNORM_V4),在 W=512 的大行 LayerNorm 场景回退到融合的 CANN 内核,并补充了对应的代码生成测试用例。 See merge request: Ascend/pytorch!45429 | 7 天前 | |
[fix][inductor] fix master triton acc-check bug Co-authored-by: l30036321<lvkaimeng@gmail.com> # message auto-generated for no-merge-commit merge: !43556 merge master into master [fix][inductor] fix master triton acc-check bug Created-by: lv-kaimeng Commit-by: l30036321 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1. 修复master上导入问题 2. 修复动态shape问题 3. 修复wrap_neg # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43556 | 29 天前 | |
[flexattention]: sync 2.7.1 bugfix to master Co-authored-by: ascend-robot<zhongyuanke@huawei.com> Co-authored-by: Stonexx<sheny1xuan@163.com> # message auto-generated for no-merge-commit merge: !45609 merge sync_master into master add flexattention score_mod support zeros_and_scatter op Created-by: stonexxx Commit-by: ascend-robot;Stonexx Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> https://gitcode.com/Ascend/pytorch/issues/4496 # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45609 | 3 天前 | |
[fix][inductor] fix master triton acc-check bug Co-authored-by: l30036321<lvkaimeng@gmail.com> # message auto-generated for no-merge-commit merge: !43556 merge master into master [fix][inductor] fix master triton acc-check bug Created-by: lv-kaimeng Commit-by: l30036321 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1. 修复master上导入问题 2. 修复动态shape问题 3. 修复wrap_neg # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43556 | 29 天前 | |
adapt pytorch2.13 for_inductor Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: zhoupeng<zp2165064878@163.com> # message auto-generated for no-merge-commit merge: !41858 merge pta_master0714 into master adapt pytorch2.13 for_inductor Created-by: TonyYA Commit-by: TonyYA;zhoupeng Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/pytorch/issues/3056 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1、本次修改将2.10的inductor代码(截至7.11最后一笔)同步到master(2.13)分支 2、针对社区接口变动及参数调整做适配修改 3、整体架构保持与2.10 inductor一致,未做架构级别重构调整 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 端到端模型验证表格 https://onebox.huawei.com/v/6d6647cf5de9b3f8a5118370ddb7a875?type=1&sheet=master%E5%88%86%E6%94%AF%E6%A8%A1%E5%9E%8B%E6%B5%8B%E8%AF%95 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!41858 | 1 个月前 | |
[fix][inductor] fix master triton acc-check bug Co-authored-by: l30036321<lvkaimeng@gmail.com> # message auto-generated for no-merge-commit merge: !43556 merge master into master [fix][inductor] fix master triton acc-check bug Created-by: lv-kaimeng Commit-by: l30036321 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1. 修复master上导入问题 2. 修复动态shape问题 3. 修复wrap_neg # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43556 | 29 天前 | |
[fix][inductor] fix master triton acc-check bug Co-authored-by: l30036321<lvkaimeng@gmail.com> # message auto-generated for no-merge-commit merge: !43556 merge master into master [fix][inductor] fix master triton acc-check bug Created-by: lv-kaimeng Commit-by: l30036321 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1. 修复master上导入问题 2. 修复动态shape问题 3. 修复wrap_neg # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!43556 | 29 天前 | |
refactor: correct English grammar, spelling, and style in log/warning messages Co-authored-by: wanglijun55<wanglijun54@huawei.com> # message auto-generated for no-merge-commit merge: !44119 merge master-doc into master refactor: correct English grammar, spelling, and style in log/warning messages Created-by: wanglijun55 Commit-by: wanglijun55 Merged-by: ascend-robot Description: # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/3908 - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [x] 重构优化 - [ ] 资料更新 # 【修改方案】 对 torch_npu 全仓 UserWarning / logger.warning / print 日志中的英文消息进行语法、拼写、标点审查和修复。共修复 48 处错误,涉及 39 个文件,涵盖以下类别: 1. **语法错误 (14处):** will not to be linked → will not be linked、should to be initialized → should be initialized、Create ... failed → Failed to create ... 等 2. **逗号拼接句 (8处):** 将逗号连接的两个独立句子拆分为两句或使用分号 3. **拼写错误 (1处):** Detecct_type → Detect_type 4. **缺少冠词 (7处):** in future version → in a future version、only sets Global variable → only sets the global variable 5. **主谓不一致 (5处):** Environment variable ... is not set → are not set、There is no ... events → There are no ... events 6. **标点/格式 (8处):** 中文顿号 、 → 英文逗号、多余空格、缺失句号、相邻字符串缺少空格拼接导致粘连 7. **翻译不当 (2处):** soft chain → symbolic link(软链接) 8. **冗余前缀 (2处):** warnings.warn() 中重复的 Warning: 前缀 9. **代码 Bug (1处):** serialization.py:672 — print() 传入 tuple 而非 string 10. **风格问题:** for replacement → as a replacement、Torchinductor → TorchInductor、Can not → Cannot、func/msg → function/message 等 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 仅修改日志/警告消息字符串,不影响任何功能逻辑。所有修改均为: - 英文语法/拼写/标点修正 - 字符串拼接 bug 修复(serialization.py tuple → string) - 翻译术语规范化(soft chain → symbolic link) # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!44119 | 24 天前 | |
refactor(inductor): isolate NPU integrations by device Co-authored-by: Xuan Peng<hin.meego@gmail.com> # message auto-generated for no-merge-commit merge: !42564 merge br/inductor-refactor-part1-0723 into master refactor(inductor): isolate NPU integrations by device Created-by: HinPeng Commit-by: Xuan Peng Merged-by: ascend-robot Description: Issue: https://gitcode.com/Ascend/pytorch/issues/3329 ## Summary PyTorch Inductor keeps lowerings in a global registry. Previously, importing torch_npu replaced community lowerings globally, so CPU nodes in a mixed CPU/NPU FX graph could enter NPU-specific lowering and autotuning paths. This change installs a device-aware lowering dispatcher: NPU nodes use the NPU lowering, while non-NPU nodes retain the original upstream lowering. ## Changes - Consolidate the NPU autotune runtime and simplify NPU scheduling setup needed by the device-specific lowering path. - Isolate FX patches by device to avoid applying NPU behavior to non-NPU graphs. - Add _make_device_lowering_dispatcher and install it around overridden Inductor lowerings. - Keep the original upstream lowering available for CPU and other non-NPU devices. - Update mm, bmm, flex_attention, and grouped MM call sites for the PyTorch 2.13 (node, choice) algorithm-selector ABI. - Make the NPU algorithm selector delegate non-NPU layouts to the upstream selector with the full PyTorch 2.13 call contract - Add coverage for device dispatch, selector compatibility, CPU GEMM fallback, and mixed-device graph partitioning. <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!42564 | 1 个月前 | |
import triton backend for mm and triton cv fusion to master branch Co-authored-by: m0_64563029<lisiyuan53@h-partners.com> Co-authored-by: TonyYA<pangjiayi@huawei.com> Co-authored-by: shi-yufeng99<shiyufeng8@huawei.com> # message auto-generated for no-merge-commit merge: !44574 merge 0814_master_triton_cv_branch1 into master import triton backend for mm and triton cv fusion to master branch Created-by: shi-yufeng99 Commit-by: shi-bibibi99;shi-yufeng99;m0_64563029;TonyYA Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 [#3016](https://gitcode.com/Ascend/pytorch/issues/3016) 本 PR 主要将 NPU Triton 后端的 mm/bmm 模板及 CV(Compute/Vector)epilogue 融合能力合入 master。核心改动包括:新增 NPU Triton 矩阵乘模板(npu_triton_mm_template、npu_persistent_mm_template、npu_triton_bmm_template)及对应的 tile 配置生成与候选注入逻辑,支持通过 {{store_output}} 融合下游逐元素算子;新增 addmm 的 bias epilogue 融合路径;同时补充了 patch_fixed_indexer 修复 size-1 维度的索引生成问题,并新增 Triton 模板启发式 template、调整 codegen_kernel_benchmark 调用签名及非进程池分支的模块加载逻辑。 主要改动 新增 NPU Triton MM 模板:在 kernel/mm.py 中新增 npu_triton_mm_template、_MM_TEMPLATE、_get_npu_mm_configs 与 add_npu_triton_mm_choices,并在 tuned_mm 中通过 use_triton_template(layout) 注入候选,使 mm 支持 Triton 内核及 {{store_output}} epilogue 融合。 新增 NPU persistent MM 模板:新增 npu_persistent_mm_template、npu_persistent_mm_grid、_get_npu_persistent_mm_configs 与 add_npu_persistent_mm_choices,采用每个 program 处理多个 tile 的对角分核策略,并通过 GROUP_M 约束保证取模运算为编译期常量。 新增 NPU Triton addmm 与 bmm 模板:add_npu_triton_addmm_choices 复用 npu_triton_mm_template 并结合 addmm_epilogue 将 bias 融合进 epilogue;npu_triton_bmm_template 通过 tl.program_id(1) 处理 batch 维,并在 tuned_bmm 中接入候选选择。 修复 _fixed_indexer 的 size-1 维度跳过问题:新增 patch_fixed_indexer(),覆盖 torch._inductor.ir._fixed_indexer 使其始终保留 idx * stride 项,避免 mm 输出存在 size-1 维时 store_output 退化为非连续路径并触发 tt.store 的 MLIR 编译错误。 补充 Triton 模板运行支撑:在 runtime/triton_heuristics.py 新增 template 启发式函数并通过 HeuristicType.TEMPLATE 调用 cached_autotune;同时在 scheduler.py 的非进程池分支直接 PyCodeCache.load,并将 codegen_kernel_benchmark 调用调整为只传 num_gb。 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!44574 | 17 天前 | |
flexattention: port flex attention overflow fixes to master Co-authored-by: a_knight<498114223@qq.com> # message auto-generated for no-merge-commit merge: !45274 merge master into master flexattention: port flex attention overflow fixes to master Created-by: a_knight Commit-by: a_knight Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/4254 https://gitcode.com/Ascend/pytorch/issues/4341 - [ ] 需求 - [x] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45274 | 9 天前 | |
[master]refactor: move shape handling into dynamo utils (#4241) Co-authored-by: stevenaw0<huangguijun@huawei.com> # message auto-generated for no-merge-commit merge: !45007 merge fix4204_master_v2 into master [master]refactor: move shape handling into dynamo utils (#4241) Created-by: stevenaw0 Commit-by: stevenaw0 Merged-by: ascend-robot Description: # 【合入来源】 - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [x] 重构优化 - [ ] 资料更新 关联 Issue: [#4094](https://gitcode.com/Ascend/pytorch/issues/4094) 关联 Issue:#4204 关联 Issue:#4241(Shape Handling 迁移到 Dynamo utils) # 【修改方案】 1. 将 NPUShapeHandling、unified_copy、Shape Handling 的 Dynamo patch 实现从 torch_npu/utils/_shape_handling.py 迁移至 torch_npu/utils/_dynamo.py。 2. 删除独立实现文件,更新 torch_npu/_inductor/shape_handling.py 为兼容 shim,保留 NPUShapeHandling、unified_copy、patch_dynamo_context 和 patch_shape_handling 的既有入口及幂等状态语义。 3. 保持 Shape Handling 配置、延迟初始化、输入变换/输出恢复以及 Dynamo/Inductor 延迟加载时序不变,不在 _dynamo.py 顶层导入 torch_npu._inductor。 # 【资料变更】 不涉及 # 【接口变更】 不涉及。保留 torch_npu._inductor.shape_handling 兼容入口。 # 【功能验证】 - 原失败用例验证通过 - shape_handling.py函数对比一致 # 【CheckList】 - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!45007 | 14 天前 | |
perf: defer dynamo and inductor imports on master Co-authored-by: stevenaw0<huangguijun@huawei.com> # message auto-generated for no-merge-commit merge: !44294 merge master_import_sync into master perf: defer dynamo and inductor imports on master Created-by: stevenaw0 Commit-by: stevenaw0 Merged-by: ascend-robot Description: ## 同步 v2.9.0_import 的 import 优化到 master ### 核心改动 将 NPU 的 Dynamo/Inductor 初始化从 import torch_npu 时立即执行改为**懒加载**: - import torch_npu 时不导入 torch._dynamo、torch._inductor、torch_npu._inductor - 仅在用户实际调用 torch.compile() 或触发 graph capture 时才初始化 Dynamo 集成 - 通过 setuptools entry points 和 meta_path finder 实现按需触发 - 支持并发首次调用、fork 后恢复、失败重试 ### 适配说明(master PyTorch 2.13+) - 保留 master 的 stream/event variable patches - 保留 make_config_entry 兼容封装(MIN_SUPPORTED >= 2.10) - 保留 master 的 _patch_flex_attention_device 和 _dump_snapshot - 合并懒加载基础设施与 master 的 new_init(name=None) 签名 ### 详见 master_syn.md 中的逐文件分类和冲突解决记录 See merge request: Ascend/pytorch!44294 | 22 天前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 2 个月前 | ||
| 7 天前 | ||
| 2 天前 | ||
| 3 天前 | ||
| 16 天前 | ||
| 6 天前 | ||
| 4 天前 | ||
| 3 天前 | ||
| 3 天前 | ||
| 1 个月前 | ||
| 2 天前 | ||
| 3 天前 | ||
| 2 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 4 天前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 1 个月前 | ||
| 9 天前 | ||
| 23 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 7 天前 | ||
| 29 天前 | ||
| 3 天前 | ||
| 29 天前 | ||
| 1 个月前 | ||
| 29 天前 | ||
| 29 天前 | ||
| 24 天前 | ||
| 1 个月前 | ||
| 17 天前 | ||
| 9 天前 | ||
| 14 天前 | ||
| 22 天前 |