| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
delete quant_all_reduce & quant_reduce_scatter Co-authored-by: yifux<xiongyifu1@huawei.com> # message auto-generated for no-merge-commit merge: !5477 merge pr_2610 into 26.1.0 delete quant_all_reduce & quant_reduce_scatter Created-by: xiongyifu Commit-by: yifux Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 https://gitcode.com/Ascend/op-plugin/issues/285 - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 master分支,26.1.0分支删除quant_all_reduce和quant_reduce_scatter算子 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 不涉及,仅删除算子不影响工程编译 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5477 | 15 天前 | |
Generate ATB public C++ interface wrappers from dispatcher schema registrations. Co-authored-by: wang_ziqi<wangziqi4@huawei.com> # message auto-generated for no-merge-commit merge: !4825 merge atb-cpp-api-interface into master Generate ATB public C++ interface wrappers from dispatcher schema registrations. Created-by: wang-ziqi-code Commit-by: wang_ziqi Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:2026-04-25 --> # 【合入来源】> <font color="red">**如有社区 issue,请关联 issue 链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部 issue 等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 https://gitcode.com/Ascend/op-plugin/issues/69 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 本次补充 ATB C++ 公共接口暴露机制,并同步收敛配置和生成器口径。 当前 ATB 算子原本主要通过 TORCH_LIBRARY_FRAGMENT(atb, m) / m.impl(...) 注册到 dispatcher,再由 Python 侧通过 torch.ops.atb 使用;本次在此基础上新增 at_npu::native::atb 命名空间下的 C++ public interface,用于 torch_npu 同构环境中的 C++ 调用方直接访问。 整体链路如下: text ::atb::implementation -> TORCH_LIBRARY_FRAGMENT(atb, m).def(...) / m.impl(...) -> torch.ops.atb (Python dispatcher entry) #python层接口 -> atb_ops.yaml + gen_atb_ops.py -> at_npu::native::atb::* (public C++ interface) #cpp层接口 具体修改如下: 1. **新增并收敛 ATB C++ 接口生成器 torchnpugen/gen_atb_ops.py** - 以 ::atb::* 实现函数签名作为 public C++ interface 的真值来源; - 以 m.def(...) / m.impl(...) 作为注册约束校验; - 读取 op_plugin/config/atb_ops.yaml 中的 cpp_name -> impl_name 映射,生成: - op_plugin/include/AtbOpsInterface.h - op_plugin/ops/atb/AtbOpsInterface.cpp - 生成器会校验: - 对应 ::atb::* 实现签名可从 op_plugin/ops/atb/*.cpp 中唯一解析。 2. **新增配置文件 op_plugin/config/atb_ops.yaml** - 维护 public C++ interface 与 ::atb::* 实现之间的映射; - 当前共覆盖 34 个 ATB 接口; - 配置写法为: yaml - cpp_name: "at_npu::native::atb::_npu_reshape_and_cache" impl_name: "atb::_npu_reshape_and_cache" - 生成器内部会解析并校验 cpp_name: - 必须以 at_npu::native::atb:: 开头; - 必须能提取出合法的末尾函数名; 3. **新增模板文件 torchnpugen/templates/AtbOpsInterface.h 和 AtbOpsInterface.cpp** - 通过 string.Template 渲染 public declaration、forward declaration 和 wrapper definition; - 生成的 wrapper 统一位于 namespace at_npu::native::atb 下; - wrapper 最终按参数原样转发到对应 ::atb::* 实现。 4. **新增统一 include 入口 op_plugin/include/atb_ops.h** - 作为 C++ 使用方的统一头文件入口; - 当前仅包含 AtbOpsInterface.h。 5. **集成到代码生成流程** - 在现有代码生成链路中加入 gen_atb_ops.py; - 保证构建过程中自动生成最新接口文件。 ### 生成产物示例 以 _npu_group_topk 为例,生成结果如下: **AtbOpsInterface.h** cpp namespace at_npu { namespace native { namespace atb { TORCH_NPU_API void _npu_group_topk(const at::Tensor &self, int64_t k, int64_t group_num, int64_t n); } // namespace atb } // namespace native } // namespace at_npu **AtbOpsInterface.cpp** cpp namespace atb { void _npu_group_topk(const at::Tensor &self, int64_t k, int64_t group_num, int64_t n); } // namespace atb namespace at_npu { namespace native { namespace atb { void _npu_group_topk(const at::Tensor &self, int64_t k, int64_t group_num, int64_t n) { ::atb::_npu_group_topk(self, k, group_num, n); } } // namespace atb } // namespace native } // namespace at_npu # 【资料变更】 不涉及 # 【接口变更】 涉及 C++ public interface 新增。 新增 AtbOpsInterface.h,在 at_npu::native::atb 命名空间下暴露 34 个 ATB public C++ API;接口签名与对应 ::atb::* 实现保持一致。C++ 调用方通过: cpp #include "atb_ops.h" 即可访问对应接口,链接目标为 libop_plugin_atb.so。 - 在 torch_npu 同构运行环境中,at_npu::native::atb::* 作为额外 C++ ABI 可用; - 接口签名与 ::atb::* 实现保持一致; - public 符号边界位于 libop_plugin_atb.so。 # 【功能验证】 1. **生成回归** - 执行 python -m torchnpugen.gen_atb_ops --config op_plugin/config/atb_ops.yaml --header op_plugin/include/AtbOpsInterface.h --source op_plugin/ops/atb/AtbOpsInterface.cpp --atb-src-dir op_plugin/ops/atb - 连续执行两次,确认生成结果稳定、无无关 diff。 2. **源码契约检查** - 执行 python test/check_atb_cpp_api_contract.py --check-source - 校验: - cpp_name -> impl_name -> m.impl -> m.def 映射成立; - wrapper 声明与 ::atb::* 实现签名一致; - wrapper 参数透传顺序一致。 3. **配置校验** - atb_ops.yaml 中 cpp_name 采用全限定写法; - 非法 cpp_name(缺前缀、缺函数名)会在生成器配置解析阶段直接报错。 4. **编译链接验证** - op-plugin 全量编译通过; - at_npu::native::atb::* public 符号由 libop_plugin_atb.so 承载。 # 【CheckList】 > PR 提交人对以下 CheckList 自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR 标题正确使用类型标签,如:feat、fix、refactor、docs、test 等 - [x] PR 持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!4825 | 2 个月前 | |
[fix] 兼容性修改 Co-authored-by: l00881990<lixinyu68@huawei.com> # message auto-generated for no-merge-commit merge: !5516 merge cherry-pick-mr-5512-1784623751094-auto into 26.1.0 [fix] 兼容性修改 Created-by: l1919_snow Commit-by: l00881990 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [x] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 A5 和A2 区分开,A5 走新分支,A2 a3 原分支 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 “不涉及” # 【功能验证】 A5 不受影响 image.png A3走index_add # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5516 | 10 天前 | |
fix npu_chunk_gated_delta_rule aclgraph undefine error Co-authored-by: liuxiao222<liuxiao222@huawei.com> # message auto-generated for no-merge-commit merge: !5489 merge fix_cgdr_26.1.0 into 26.1.0 fix npu_chunk_gated_delta_rule aclgraph undefine error Created-by: liuxiao222 Commit-by: liuxiao222 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**https://gitcode.com/Ascend/pytorch/issues/2936**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 1.修改未定义变量'state'为'initial_state' 2.将final_state的类型推导改为与initial_state相同,适配支持initial_state float32的特性 # 【资料变更】 不涉及 # 【接口变更】 不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5489 | 15 天前 | |
pageattention支持masktype Co-authored-by: 陈立<2825128415@qq.com> # message auto-generated for no-merge-commit merge: !5135 merge 26.1.0 into 26.1.0 pageattention支持masktype Created-by: gcw_zvndY5nI Commit-by: 陈立 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> https://gitcode.com/Ascend/pytorch/issues/2171 - [x] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) 原 _npu_paged_attention 没有传递mask_type参数,需要重新封装pta接口 新增op_plugin/ops/atb/PagedAttentionSplitfuseV2.cpp文件并将接口注册到torch_npu # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 仅内部使用,不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 仅内部使用,不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5135 | 1 个月前 | |
[Feature] [Randomness] Add randomness compatible blacklist handling Co-authored-by: wang_ziqi<wangziqi4@huawei.com> # message auto-generated for no-merge-commit merge: !5441 merge compatible_randomness_26.1.0 into 26.1.0 [Feature] [Randomness] Add randomness compatible blacklist handling Created-by: wang-ziqi-code Commit-by: wang_ziqi Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [x] 需求 https://gitcode.com/Ascend/pytorch/issues/2853 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) 1. 在 op_plugin/utils/RandomUtil.h 中集中实现 randomness compatible 处理逻辑,通过 torch_npu CheckCompatibleImplBlackListFor(CompatibleKey::Randomness) 查询 randomness 是否配置 legacy 实现。 2. 新增 randomness counter offset 统一入口 calc_final_counter_offset,compatible 场景使用 GPU/PyTorch 对齐 offset 计算,legacy 场景使用 LEGACY_RAND_COUNTER_OFFSET。 3. 新增 CANN random mode 配置封装 ConfigureCannRandomnessOnce,同一进程内只配置一次。配置值为 CANN_RANDOM_MODE_LEGACY = 0 或 CANN_RANDOM_MODE_COMPAT = 1。 4. PrepareRandomnessCompatible 负责组合 A5 aclnn-only 判断、randomness blacklist 查询和 CANN random mode 配置结果,返回当前是否使用 compatible randomness。 5. A5 supported randomness 调用点会显式配置 CANN random mode;aclnnSetPytorchRandom 符号不存在时打印 INFO 日志,并按 compatible randomness 处理。 6. 当前接入 supported randomness API:torch.nn.init.normal_、torch.randn、torch.normal 相关 overload、torch.nn.init.xavier_uniform_、Tensor.uniform_、Tensor.random_(from, to) / Tensor.random_(to)。 7. 当前 Tensor.random_() without from/to、Tensor.exponential_、torch_npu.npu_sim_exponential_、dropout 使用 support_cann_random_switch=false,不触发 CANN random mode 配置。 8. dropout 路径选择仍由 IsAclnnOnly() 控制;A5 aclnnDropoutV3 分支调用 PrepareRandomnessCompatible(false),当前返回值保持 compatible offset 行为。 # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” 不涉及。 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 涉及跨仓 C++ 接口依赖、环境变量配置和 CANN 接口依赖,不新增 Python API。 依赖 torch_npu C++ 接口: cpp bool CheckCompatibleImplBlackListFor(CompatibleKey compatible_key); 依赖环境变量: bash TORCH_NPU_LEGACY_IMPL_LIST=randomness 依赖 CANN 接口: cpp aclnnStatus aclnnSetPytorchRandom(int32_t pytorchRandom); # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 已执行静态检查: bash git -C op-plugin diff --check 验证场景: 1. A2/A3:配置或不配置 TORCH_NPU_LEGACY_IMPL_LIST=randomness,randomness API 正常执行,保持 A2/A3 路径行为。 2. A5 + 未配置 TORCH_NPU_LEGACY_IMPL_LIST:supported randomness API 正常执行,使用 compatible offset,并配置 CANN random mode 为 1。 3. A5 + TORCH_NPU_LEGACY_IMPL_LIST=randomness:supported randomness API 正常执行,使用 legacy offset,并配置 CANN random mode 为 0。 4. A5 + aclnnSetPytorchRandom 符号不存在:打印 INFO 日志,supported randomness API 正常执行,使用 compatible offset。 5. support_cann_random_switch=false 的调用点正常执行,不触发 CANN random mode 配置。 6. dropout 训练路径正常执行,p == 0、p == 1、train == false 快捷路径正常执行。 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!5441 | 17 天前 | |
【feature】add eager DVM lazy fusion support for PTA Eager mode Co-authored-by: hb_hubin<hubin79@huawei.com> # message auto-generated for no-merge-commit merge: !4956 merge pta-dvm-master into master 【feature】add eager DVM lazy fusion support for PTA Eager mode Created-by: hbhu_bin Commit-by: hb_hubin Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [x] 需求 - [ ] 问题单 - [ ] issue/工单 - [ ] 重构优化 - [ ] 资料更新 https://gitcode.com/Ascend/pytorch/issues/1732 # 【修改方案】 PTA使能eager模式dvm无图融合算子,**开启 TORCH_NPU_LAZY_FUSION=True进行使能**;**不开启时,对原有eager流程无影响** 架构设计 ┌────────────────────────────────────────────────────────────┐ │ PyTorch Eager │ │ torch.add(x, y) / x.silu_() / ... │ └──────────────────────────┬─────────────────────────────────┘ │ aten 调用 ┌──────────────────────────▼─────────────────────────────────┐ │ torch_npu 派发层(codegen 生成) │ │ if (lazy_fusion::IsEnabled("op")) → lazy_fusion::op() │ │ else → op_api::op() / acl_op::op() │ └──────────────────────────┬─────────────────────────────────┘ │ ┌──────────────────┼──────────────────┐ │ │ │ ┌───────▼──────┐ ┌────────▼─────────┐ ┌──────▼─────────┐ │ acl_op:: │ │ op_api:: │ │ lazy_fusion:: │ │ (acl 算子) │ │ (aclnn 算子) │ │ (DVM 融合) │ └──────────────┘ └──────────────────┘ └──────┬─────────┘ │ ┌─────────────▼──────────────┐ │ LazyFusionKernel │ │ - 累积算子到 DVM 图 │ │ - 跨边界自动 Flush │ │ - 调用 dvm::Kernel CodeGen│ └─────────────┬──────────────┘ │ ┌─────────────▼──────────────┐ │ libdvm.a (三方库) │ │ - IR 优化 / 算子融合 │ │ - AiCore kernel 代码生成 │ │ - workspace 管理 │ └────────────────────────────┘ # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” op-plugin PR不涉及 # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” 不涉及 # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 torch_npu的修改泛化验证97个UT(PR会进行精简),每个UT开启DVM+关闭DVM跑俩遍,比较二者的精度。用例包括:所有涉及单算子用例(多shape+多dtype)、与其他特性协同(aclgraph)、组合算子测试、view场景等 新增UT已全量pass  精简用例之后(24个),全部通过  # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [x] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/op-plugin!4956 | 2 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 15 天前 | ||
| 2 个月前 | ||
| 10 天前 | ||
| 15 天前 | ||
| 1 个月前 | ||
| 17 天前 | ||
| 2 个月前 |