已关闭
[Requirement|需求建议]: 新增 CMO 直接与描述符式预取策略对比样例 #964
Yanxijiu创建于  9 天前关闭于  6 天前
Yanxijiu
Yanxijiu成员
9 天前 创建

Backgroud(背景信息)

当前 example/3_memory_advanced/cache_maintenance/ 缺少可运行的 CMO 预取样例,开发者难以直观了解一次性工作集与重复使用工作集应如何选择预取方式,以及描述符式预取与 Model RI 的配合流程。

期望新增 0_prefetch_strategy_comparison 样例,对比以下两种方式:

  • 使用 aclrtCmoAsync 对一次性工作集执行直接异步预取。
  • 使用 aclrtCmoGetDescSizeaclrtCmoSetDescaclrtCmoAsyncWithDesc 对重复使用工作集执行描述符式异步预取。

Origin(信息来源)

易用性提升

Benefit / Necessity(价值/作用)

  • 提供 CMO 直接预取和描述符式预取的完整可运行参考。
  • 展示 CMO 描述符的查询、分配、配置和使用流程。
  • 展示描述符式预取在持久化 Stream 和最小 Model RI 中的构建、绑定与执行方法。
  • 通过相同输入和 Kernel 校验两种策略的计算结果,降低接口理解和使用成本。

Design(设计方案)

  1. example/3_memory_advanced/cache_maintenance/ 下新增样例目录。
  2. 准备两份内容相同的 256 元素 Device 工作集。
  3. 普通 Stream 使用 aclrtCmoAsync 执行直接预取。
  4. 持久化 Stream 使用 CMO 描述符执行预取,并通过 Model RI 构建和执行任务。
  5. 两条路径运行相同的 Ascend C Kernel,计算 output = input * 3 + 7
  6. 逐元素校验两路输出均符合预期且完全一致。
  7. 补充中英文 README、CMakeLists.txt、run.sh 及上级目录导航。
likedislike
YanxijiuYanxijiu成员
9 天前 关联了pull request:【PR】: 新增 CMO 预取策略对比样例
YanxijiuYanxijiu成员
9 天前 关联了pull request:【PR】: 新增 CMO 预取策略对比样例
ykl999
ykl999成员
6 天前 评论:

新增example已合入,issue关闭

likedislike
ykl999ykl999成员
6 天前 issue状态由 待办的 改变为 已解决
ykl999ykl999成员
6 天前 关闭了 issue