| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
【质量加固】补充成员函数 const 修饰以符合编码规范(#517) Co-authored-by: qoosong<qoosong.seu@qq.com> # message auto-generated for no-merge-commit merge: !4608 merge fix/quality-hardening-warnings into develop 【质量加固】补充成员函数 const 修饰以符合编码规范(#517) Created-by: qoosong Commit-by: qoosong Merged-by: cann-robot Description: ## 描述 响应 #517 "质量加固" 社区活动,修复 ge 仓中不符合规则1(成员函数 const 修饰)的代码问题。 不会修改成员变量的成员函数应使用 const 修饰。本次共修复 15 处成员函数缺少 const 修饰的问题,涉及 10 个文件,与既有 PR(#4597/#4594/#4497/#4572/#4496)无重复或冲突。 涉及文件及修复点: | 文件 | 修复的成员函数 | 说明 | |------|--------------|------| | inc/graph_metadef/register/graph_optimizer/buffer_fusion/buffer_fusion_pass_base.h | BufferFusionPassBase::GetName() | 返回 name_,不修改状态 | | inc/graph_metadef/register/ffts_node_converter_registry.h | SkipCtxRecord::GetCtxNum() | 仅读取 ctx_id_v->size() | | inc/framework/runtime/subscriber/global_profiler.h | GlobalProfilingWrapper::GetRecordCount() | 调用 const 的 GetCount() | | inc/framework/runtime/subscriber/global_profiler.h | GlobalProfilingWrapper::IsEnabled() | 仅读取 atomic load() | | inc/framework/runtime/subscriber/global_dumper.h | GlobalDumper::GetHandleSize() | 仅读取 size(),mutex 改为 mutable | | inc/graph_metadef/common/blocking_queue.h | BlockingQueue::GetRemainItems() / IsFull() / Size() | 仅读取,mutex 改为 mutable | | runtime/v1/graph/load/model_manager/data_inputer.h | DataInputer::Size() | 转调 const 的 queue_.Size() | | runtime/v1/graph/load/model_manager/davinci_model.h | DavinciModel::GetDataInputerSize() | 转调 const 的 data_inputer_.Size() | | compiler/analyzer/analyzer.h | Analyzer::IsEnableNetAnalyzeDebug() | 仅读取环境变量 | | compiler/engines/nn_engine/fusion/.../fusion_rule_parser_utils.h | FusionRuleParserUtils::GetEngineName() | 仅返回 engine_name_,mutex 改为 mutable | | compiler/engines/nn_engine/fusion/.../fusion_rule_json_pattern.h | FusionRuleJsonNode::GetName() / FusionRuleJsonAnchor::GetSrcNode() / FusionRuleJsonAnchor::GetName() | 仅返回成员变量 | 对于需要加锁的只读访问(GlobalDumper::GetHandleSize、BlockingQueue::IsFull/Size/GetRemainItems、FusionRuleParserUtils::GetEngineName),将互斥量声明为 mutable,以支持 const 成员函数内部的加锁,与既有 PR #4597 中 NodeDoneManager::Cond/DeployPlan 的处理方式一致。 ## 变更类型 - [ ] 🐛 Bug 修复 - [ ] ✨ 新功能 - [x] 💄 代码风格更新(格式化,局部变量) - [x] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue #517 ## 如何测试 1. 本地执行 pre-commit 检查(clang-format/codespell/end-of-file-fixer 等)全部 Passed 2. 变更均为添加 const 修饰及 mutable 互斥量,不改变运行时行为,编译期即可验证 ## 核对清单 - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [x] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如:fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定 See merge request: cann/ge!4608 | 28 天前 | |
【feat】: JIT 调度与切图解耦,开启自动融合时整图jit执行 Co-authored-by: chengyutao3<chengyutao3@huawei.com> # message auto-generated for no-merge-commit merge: !4566 merge develop into develop 【feat】: JIT 调度与切图解耦,开启自动融合时整图jit执行 Created-by: chengyutao3 Commit-by: chengyutao3 Merged-by: cann-robot Description: # Pull Request ## 描述 本 PR 将 AutoFuse JIT 执行能力从“支持切片调度的图”扩展为“整图 JIT”模式。 主要变更内容如下: 1. 新增 EnableAutoFuse(),统一判断 AutoFuse 是否启用,并将 AutoFuse 模式下的图管理、编译、加载、执行及运行模式设置统一路由至 UserGraphsManager。 2. 扩展 UserGraphControl,支持整图的动态添加、编译、加载和执行: - 支持 ge::Tensor 和 gert::Tensor 两类输入输出。 - 支持普通执行和带 Stream 的异步执行。 - 支持保存、获取和设置 RunGraphMode。 - 在控制器结束时清理临时创建的整图实例。 3. 调整执行顺序生成逻辑: - 支持切片调度的图继续执行符号推导和二分切图。 - 不支持切片调度的图直接以整图方式编译执行。 - 整图模式下提前创建或更新 NetOutput,确保输出大小信息能够正确校正。 - 增加 WholeGraph_ 和 SlicedGraph_ 图 Dump 前缀,便于区分调试产物。 4. 调整 Session 和 GeSession V2 的接口调用: - AutoFuse 模式下,RunGraph、RunGraphWithStreamAsync、编译及加载流程统一使用 JIT 图管理路径。 - AutoFuse 模式下禁止设置或更新图常量内存、Feature 内存,并将错误提示从“slice scheduler”更新为“JIT executor”。 - 避免在 AutoFuse 模式下重复执行传统图加载逻辑。 5. 移除原有“不支持 Slice Schedule 图”的黑名单逻辑,改为在 AutoFuse 模式下统一创建 UserGraphControl,由执行顺序决定采用切片编译或整图编译。 6. 更新 AutoFuse 系统测试,使其通过真实的 CompileGraph 流程触发编译,并从 JIT 编译缓存中的图副本检查融合结果。 7. 新增和完善相关单元测试,覆盖: - 整图静态 Shape 执行。 - GeTensor 和 gert::Tensor 输入输出执行。 - Stream 异步执行。 - AutoFuse 模式下 RunGraphMode 的获取与设置。 - AutoFuse 模式下图内存接口不支持场景。 8. 调整测试图输入尺寸及相关测试构建头文件路径,以适配整图 JIT 流程。 ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> 暂无关联 Issue。 ## 如何测试 描述测试此变更的步骤和前提条件: 前提条件: - 已完成 GE 项目依赖和编译环境配置。 - 测试环境支持 GE UT/ST 构建。 - AutoFuse 测试需要设置 AUTOFUSE_FLAGS,启用 --enable_autofuse=true;涉及切片调度的测试还需要启用 --experimental_enable_jit_executor_v2=true。 1. 编译 GE 相关组件及测试目标: bash bash build.sh --ge_compiler --ge_executor 2. 编译并运行 JIT Execution 相关单元测试,重点检查以下测试文件: - tests/ge/ut/ge/jit_execution/execution_order_unittest.cc - tests/ge/ut/ge/jit_execution/jit_executor_unittest.cc - tests/ge/ut/ge/jit_execution/user_graph_ctrl_unittest.cc - tests/ge/ut/ge/jit_execution/user_graph_manager_unittest.cc 3. 运行 Session V2 API 单元测试,重点验证 AutoFuse 模式下图执行及图内存接口行为: - tests/ge/ut/ge/session_v2/ge_api_v2_unittest.cc - SliceSchedule_UnsupportedPaths 4. 运行 AutoFuse 系统测试: - tests/ge/st/testcase/autofuse/autofuse_canfuse_test.cc 验证水平融合、垂直融合以及不同算子组合的融合结果,并确认测试通过 Session::CompileGraph 触发真实 JIT 编译,从 JIT 编译图副本中检查 AscBackend 和融合属性。 5. 重点验证以下场景: - 支持 Slice Schedule 的图仍可正常切片编译。 - 不支持 Slice Schedule 的图可以通过整图 JIT 路径完成编译、加载和执行。 - 普通 RunGraph、RunGraphAsync 以及 RunGraphWithStreamAsync 路径均能正确路由。 - AutoFuse 模式下设置图常量内存或 Feature 内存时返回 UNSUPPORTED,且日志提示为 JIT executor 不支持。 ## 核对清单 <!-- [x] 表示选中 --> - [x] 我的代码遵循了项目的代码风格 - [ ] 我已对代码进行了自测 - [ ] 我已更新了相关的文档 - [ ] 我在标题中使用了合适的类型标签(如:feat:, fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 - 本次提交共修改 19 个文件,新增约 495 行代码,删除约 187 行代码。 See merge request: cann/ge!4566 | 1 个月前 | |
!4638 merge develop into master 【PR】: sync develop to master 0829 Created-by: depeng1994 Commit-by: lidaoming1;du-hua1024;liyanrong_9;KenChow;zyzoe;2402_87730846;jiang-mingming01;tang-haojie;WXQ123123;cann-robot;wys222111;cnsd_turtle;wxh456;chengyutao3;yelongjian;Fiee16267377383;Chang-an-HW;lushiming0;QWH789456;jsong27;ClarkXie;wuzheng-hw;likun104;gentle-knight Merged-by: cann-robot Description: # Pull Request ## 描述 请清晰准确地描述本次 Pull Request 的意图和变更内容。 ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> ## 如何测试 描述测试此变更的步骤和前提条件: 1. 2. ## 核对清单 <!-- [x] 表示选中 --> - [ ] 我的代码遵循了项目的代码风格 - [ ] 我已对代码进行了自测 - [ ] 我已更新了相关的文档 - [ ] 我在标题中使用了合适的类型标签(如: feat:, fix:) - [ ] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 在此添加任何其他关于本次 PR 的说明。 See merge request: cann/ge!4638 | 26 天前 | |
fix: 完善 HostCPU 自定义算子的引擎选择 Co-authored-by: du-hua1024<duhua2@huawei.com> # message auto-generated for no-merge-commit merge: !4630 merge new into develop fix: 完善 HostCPU 自定义算子的引擎选择 Created-by: du-hua1024 Commit-by: du-hua1024 Merged-by: cann-robot Description: # Pull Request ## 描述 完善 HostCPU 自定义算子的引擎选择,保证 HostCPU 自定义实现不会被普通 HostCPU 引擎覆盖: - 在 EnginePlacer 节点指定engine时,不会进入DNNEngineManager 选择引擎,因此补充逻辑,在完成引擎选择后,仅对已选择 DNN_VM_HOST_CPU 且存在 HostCPU 自定义实现的节点切换为 DNN_VM_CUSTOM。 - 保留 DNNEngineManager 原有的显式 Host 放置、直接引擎选择及 HostCPU custom 回退逻辑,兼容无普通 HostCPU kernel store 的场景。 - 增加引擎字段、引擎属性和设备引擎保护场景的 UT。 - 修正融合示例中 GEMM scalar 常量的类型为 float,适配当前算子优化支持范围。 ## 变更类型 - [x] 🐛 Bug 修复 - [ ] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue 无 ## 如何测试 - 已补充 EnginePlacer HostCPU custom 相关 UT。 ## 核对清单 - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [ ] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如:feat:, fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md) ## 其他信息 无 See merge request: cann/ge!4630 | 28 天前 | |
fix: precommit整改 Co-authored-by: yelongjian<yelongjian1@huawei.com> # message auto-generated for no-merge-commit merge: !3726 merge dev-precommit into develop fix: precommit整改 Created-by: yelongjian Commit-by: yelongjian Merged-by: cann-robot Description: # Pull Request ## 描述 precommit整改 ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新功能 - [x] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> ## 如何测试 描述测试此变更的步骤和前提条件: 1.NA ## 核对清单 <!-- [x] 表示选中 --> - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [x] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如: feat:, fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 在此添加任何其他关于本次 PR 的说明。 See merge request: cann/ge!3726 | 2 个月前 | |
【PR】: 内部头文件重名整改 -- 同名不同内容 Co-authored-by: jikai-tyler<jikai5@huawei.com> # message auto-generated for no-merge-commit merge: !3497 merge ge_header_internal_2 into develop 【PR】: 内部头文件重名整改 -- 同名不同内容 Created-by: jikai-tyler Commit-by: jikai-tyler Merged-by: cann-robot Description: # Pull Request ## 描述 | 原文件路径 | 原名 | 修改后名称 | |-----------|------|-----------| | base/common/helper/mobile/ | model.h | mobile_model.h | | base/common/math/ | math_util.h | ge_math_util.h | | compiler/engines/cpu_engine/common/util/ | log.h | aicpu_log.h | | compiler/engines/cpu_engine/inc/ | graph_pass.h | cpu_engine_graph_pass.h | | compiler/engines/cpu_engine/inc/ | pass.h | cpu_engine_pass.h | | compiler/engines/cpu_engine/tf_engine/tf_optimizer/ | tensorflow_util.h | tf_optimizer_tensorflow_util.h | | compiler/engines/hccl_engine/hcom_graph_adaptor/ge_plugin/calculation_tool/ | model.h | hcom_model.h | | compiler/engines/hccl_engine/hcom_graph_adaptor/ge_plugin/ | plugin_manager.h | hcom_plugin_manager.h | | compiler/engines/local_engine/ops_kernel_store/op/ | op.h | ge_local_op.h | | compiler/engines/local_engine/ops_kernel_store/op/ | op_factory.h | ge_local_op_factory.h | | compiler/engines/manager/engine/ | engine_manager.h | dnn_engine_manager.h | | compiler/engines/manager/opskernel_manager/ | ops_kernel_manager.h | dnn_ops_kernel_manager.h | | compiler/engines/nn_engine/inc/common/ | math_util.h | nn_engine_math_util.h | | compiler/engines/nn_engine/optimizer/ops_kernel_builder/task_builder/ | dsa_task_builder.h | ops_kernel_dsa_task_builder.h | | compiler/engines/nn_engine/utils/common/ | plugin_manager.h | nn_engine_plugin_manager.h | | compiler/engines/rts_engine/common/util/ | log.h | rts_log.h | | compiler/graph/build/stream/ | stream_allocator.h | graph_stream_allocator.h | | compiler/graph/common/compress/inc/ | log.h | compress_log.h | | compiler/graph/eager_style_graph_builder/es_generator/ | utils.h | es_generator_utils.h | | compiler/graph/passes/ | pass.h | compiler_pass.h | | compiler/opcompiler/op_compile_adapter/source/compile/ | fusion_manager.h | opcompiler_fusion_manager.h | | dflow/llm_datadist/v1/common/ | cache_manager.h | llm_datadist_cache_manager.h | | dflow/llm_datadist/v1/common/ | llm_common.h | llm_datadist_common.h | | dflow/llm_datadist/v1/common/ | mem_utils.h | llm_datadist_mem_utils.h | | dflow/pydflow/wrapper/ | utils.h | pydflow_utils.h | | dflow/udf/execute/ | memory_statistic_manager.h | udf_memory_statistic_manager.h | | dflow/udf/flow_func/ | flow_model.h | udf_flow_model.h | | inc/framework/common/ | op_types.h | framework_op_types.h | | inc/graph_metadef/common/ge_common/debug/ | log.h | ge_common_log.h | | inc/graph_metadef/graph/utils/ | mem_utils.h | graph_mem_utils.h | | inc/graph_metadef/register/graph_optimizer/graph_fusion/ | connection_matrix.h | fusion_connection_matrix.h | | inc/graph_metadef/register/graph_optimizer/graph_fusion/ | graph_pass.h | graph_fusion_graph_pass.h | | inc/graph_metadef/register/graph_optimizer/graph_fusion/ | pass.h | graph_fusion_pass.h | | parser/parser/common/ | graph_pass.h | parser_graph_pass.h | | parser/parser/common/ | pass.h | parser_pass.h | | runtime/v1/graph/load/model_manager/task_info/ffts_plus/ | ffts_plus_proto_transfer.h | v1_ffts_plus_proto_transfer.h | | runtime/v1/graph/manager/ | host_mem_allocator.h | v1_host_mem_allocator.h | | runtime/v1/hybrid/model/infer/ | shape_utils.h | hybrid_shape_utils.h | | runtime/v2/core/utils/ | executor_utils.h | rt2_executor_utils.h | | runtime/v2/core/utils/ | tensor_utils.h | rt2_tensor_utils.h | | runtime/v2/utils/ | utils.h | rt2_utils.h | ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> ## 如何测试 描述测试此变更的步骤和前提条件: 1. 2. ## 核对清单 <!-- [x] 表示选中 --> - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [x] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如: feat:, fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 在此添加任何其他关于本次 PR 的说明。 See merge request: cann/ge!3497 | 2 个月前 | |
【feature】: superkernel适配MC2算子AICPU模式record/notify task处理 Co-authored-by: jsong27<songjiaming6@h-partners.com> # message auto-generated for no-merge-commit merge: !4446 merge develop into develop 【feature】: superkernel适配MC2算子AICPU模式record/notify task处理 Created-by: jsong27 Commit-by: jsong27 Merged-by: cann-robot Description: # Pull Request ## 描述 superkernel适配MC2算子AICPU模式record/notify task处理 ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [x] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> ## 如何测试 描述测试此变更的步骤和前提条件: 1. 2. ## 核对清单 <!-- [x] 表示选中 --> - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [ ] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如: feat:, fix:) - [ ] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 在此添加任何其他关于本次 PR 的说明。 See merge request: cann/ge!4446 | 28 天前 | |
fix: precommit整改 Co-authored-by: yelongjian<yelongjian1@huawei.com> # message auto-generated for no-merge-commit merge: !3726 merge dev-precommit into develop fix: precommit整改 Created-by: yelongjian Commit-by: yelongjian Merged-by: cann-robot Description: # Pull Request ## 描述 precommit整改 ## 变更类型 请选择本次引入的变更类型: <!-- [x] 表示选中 --> - [ ] 🐛 Bug 修复 - [ ] ✨ 新功能 - [x] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 关联的Issue <!-- 如果这个PR是为了解决特定的Issue,请在当前页面的右侧'关联Issue'部分添加相应Issue链接,并勾选'合并后关闭已关联的 Issue'选项。 --> ## 如何测试 描述测试此变更的步骤和前提条件: 1.NA ## 核对清单 <!-- [x] 表示选中 --> - [x] 我的代码遵循了项目的代码风格 - [x] 我已对代码进行了自测 - [x] 我已更新了相关的文档 - [x] 我在标题中使用了合适的类型标签(如: feat:, fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守了其中的所有规定,包括但不限于commit message的格式、无效commit的合并等 ## 其他信息 在此添加任何其他关于本次 PR 的说明。 See merge request: cann/ge!3726 | 2 个月前 | |
feat: part2 完善HostCPU自定义算子运行时与常量折叠支持 Co-authored-by: du-hua1024<duhua2@huawei.com> # message auto-generated for no-merge-commit merge: !4538 merge new into develop feat: part2 完善HostCPU自定义算子运行时与常量折叠支持 Created-by: du-hua1024 Commit-by: du-hua1024 Merged-by: cann-robot Description: # Pull Request ## 描述 本 PR 完善后端感知自定义算子的 HostCPU 执行链路,打通编译期识别与分流、Runtime V2 下沉执行、ShapeInfer、常量折叠及配套单元测试。HostCPU 自定义算子使用独立的 lowering 标识和执行上下文,避免被当作 Device 自定义算子编译或按 AI Core 归属分区。 ## 主要修改点 ### 1. HostCPU 自定义算子编译与分区 - 在 DNNEngineManager 中识别注册到 OpBackend::kHostCPU 的自定义算子,并将其设置为 Custom Engine、Custom Op Kernel Lib,同时写入 host_cpu_custom_op_lower_func lowering 属性。 - 在 HostcpuEngineUpdatePass 中保留 HostCPU 自定义算子的 Custom Engine 归属,避免被错误迁移到普通 HostCPU 或 Device 执行路径。 - 在 EnginePartitioner 二次分区时区分 Device 自定义算子和 HostCPU 自定义算子:前者跟随 AI Core,后者跟随 DNN_VM_HOST_CPU。 - 在动态 Shape 分区及未知 Shape 标记流程中,将 HostCPU 自定义算子按 HostCPU 节点处理。 - 在 Custom Engine 编译任务生成阶段跳过 HostCPU 自定义算子的 Device 编译;算子支持性检查改为使用后端感知注册信息。 ### 2. Runtime V2 HostCPU 自定义算子执行 - 新增 HostCPU 自定义算子 converter: - 从 Host 侧 lowering 结果构造输入 Tensor 和地址; - 使用 Host allocator 分配输出; - 注册 host_cpu_custom_op_lower_func 对应的节点 converter; - 增加输出内存释放及输入地址生命周期依赖。 - 新增 HostCPU 自定义算子 kernel: - 查找 HostCPU 自定义算子实例; - 支持 ExecuteHostCustomOp 和 ExecuteHostCustomOpWithInferShape; - 使用 HostCpuOpExecutionContext 调用 HostCpuExecuteOp::Execute; - 补充输出创建、Trace 和 Profiling 逻辑。 - ShapeInfer 链路改为通过 kShapeInfer 能力获取 ShapeInferOp,新增 FindCustomShapeInferOp kernel,避免先获取通用 BaseCustomOp 再转换。 - 抽取公共输出模板 Tensor 处理逻辑,兼容 Device 和 HostCPU 两类自定义算子执行路径。 ### 3. HostCPU 自定义算子常量折叠 - 在常量折叠阶段优先尝试执行注册为 HostCpuExecuteOp 的自定义算子。 - 新增 HostCPU 常量折叠专用内存分配器、TensorData 管理和 HostCpuOpExecutionContext 构造逻辑。 - 将 GE Tensor 转换为 GERT Tensor,执行 HostCPU 自定义算子后再转换回 GE Tensor。 - HostCPU 自定义算子执行失败时,继续回退到已有 HostCPU Kernel 和内置 Kernel 路径。 ### 4. 执行上下文、构建及可观测性 - 将 MakeOutputRefInput 调整为非 const 接口,移除内部 const_cast,同步更新实现、头文件及离线 stub。 - 增加 HostCPU 自定义算子 lowering 常量、Profiler 类型注册及 compiler 对 gert 的链接依赖。 - 更新相关 Runtime V2、编译器和 ShapeInfer 接口声明。 ### 5. 测试覆盖 新增或扩展以下单元测试: - HostCPU 自定义算子引擎更新、DNN Engine 选择及图分区; - 动态/未知 Shape 分区; - HostCPU 自定义算子常量折叠; - Runtime V2 custom converter、kernel 及 ShapeInfer; - 自定义算子 Kernel Info Store 后端感知检查。 ## 变更类型 - [ ] 🐛 Bug 修复 - [x] ✨ 新功能 - [ ] 💄 代码风格更新(格式化,局部变量) - [ ] ♻️ 重构(既不修复错误也不增加功能的代码变动) - [ ] 📦 构建过程或辅助工具的变动 - [ ] 📝 文档内容更新 ## 如何测试 - 编译 GE compiler、Runtime V2 及相关单元测试目标。 - 执行 HostCPU 自定义算子引擎更新、图分区、常量折叠、Runtime V2 converter/kernel 相关 UT。 - 验证 Device 自定义算子路径保持原有编译、分区和执行行为。 ## 核对清单 - [x] 我的代码遵循了项目的代码风格 - [x] 我已补充相关单元测试 - [x] 我已更新全部相关文档 - [x] 我在标题中使用了合适的类型标签(如:feat:、fix:) - [x] 我已经详细阅读了贡献指南(CONTRIBUTING.md),并遵守其中的相关规定 ## 其他信息 本 PR 相对目标分支涉及 33 个文件,新增约 1384 行、删除约 50 行。Device 自定义算子与 HostCPU 自定义算子通过后端注册信息和 lowering 属性区分,HostCPU 路径不会进入 Device 自定义算子编译流程。 See merge request: cann/ge!4538 | 29 天前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 28 天前 | ||
| 1 个月前 | ||
| 26 天前 | ||
| 28 天前 | ||
| 2 个月前 | ||
| 2 个月前 | ||
| 28 天前 | ||
| 2 个月前 | ||
| 29 天前 |