已合并
docs:CANN相关链接修改 #397
cai-weiwei1989创建于 8月4日
docs:CANN相关链接修改 #397
已合并
共 3 个文件变更+5-5
| @@ -31,7 +31,7 @@ | |||
| 31 | 31 | ||
| 32 | 2、除此以外,部分流同步业务可能是环境变量引入,例如 | 32 | 2、除此以外,部分流同步业务可能是环境变量引入,例如 |
| 33 | 33 | ||
| 34 | -[ASCEND_LAUNCH_BLOCKING](https://gitcode.com/Ascend/pytorch/blob/v2.7.1/docs/zh/environment_variable_reference/ASCEND_LAUNCH_BLOCKING.md) | 34 | +[ASCEND_LAUNCH_BLOCKING](https://gitcode.com/Ascend/pytorch/blob/master/docs/zh/api/environment_variable/op_execution/ASCEND_LAUNCH_BLOCKING.md) |
| 35 | 就会对每个算子进行流同步,用以定位问题。 | 35 | 就会对每个算子进行流同步,用以定位问题。 |
| 36 | 36 | ||
| 37 | # 六、定位方法总结 | 37 | # 六、定位方法总结 |
| @@ -20,7 +20,7 @@ | |||
| 20 | 20 | ||
| 21 | - 可通过环境变量调整日志等级和输出路径:`export ASCEND_GLOBAL_LOG_LEVEL=0`(设置日志等级),`export ASCEND_PROCESS_LOG_PATH=/path/to/plog`(自定义输出路径)。 | 21 | - 可通过环境变量调整日志等级和输出路径:`export ASCEND_GLOBAL_LOG_LEVEL=0`(设置日志等级),`export ASCEND_PROCESS_LOG_PATH=/path/to/plog`(自定义输出路径)。 |
| 22 | - 当遇到数据采集失败、host目录为空等问题时,建议优先查看PLOG中的ERROR/WARNING日志以快速定位原因。 | 22 | - 当遇到数据采集失败、host目录为空等问题时,建议优先查看PLOG中的ERROR/WARNING日志以快速定位原因。 |
| 23 | -- 参考文档:[昇腾环境变量参考](https://www.hiascend.com/document/detail/zh/canncommercial/900/maintenref/envvar/envref_07_0122.html)。 | 23 | +- 参考文档:[昇腾环境变量参考](https://www.hiascend.com/document/detail/zh/CANNCommunityEdition/latest/maintenref/envvar/envref_07_0001.html)。 |
| 24 | 24 | ||
| 25 | - **Q:使用msprof采集算子数据,host目录为空没有数据?** | 25 | - **Q:使用msprof采集算子数据,host目录为空没有数据?** |
| 26 | - A:优先检查Plog报错,可能存在的情况如下: | 26 | - A:优先检查Plog报错,可能存在的情况如下: |
| @@ -429,7 +429,7 @@ op\_summary\_\*.csv文件根据msprof采集参数取值不同,文件呈现结 | |||
| 429 | |*_mte3_ratio|mte3类型指令(AICORE->DDR搬运类指令)的cycle数在total cycle数中的占用比。| | 429 | |*_mte3_ratio|mte3类型指令(AICORE->DDR搬运类指令)的cycle数在total cycle数中的占用比。| |
| 430 | |*_icache_miss_rate|icache是为instruction预留的L2 Cache,icache_miss_rate数值高代表AI Core读取指令的效率低。| | 430 | |*_icache_miss_rate|icache是为instruction预留的L2 Cache,icache_miss_rate数值高代表AI Core读取指令的效率低。| |
| 431 | |memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。| | 431 | |memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。| |
| 432 | -|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:cube_utilization = total_cycles / (freq * core_num * task_duration)。| | 432 | +|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:`cube_utilization = total_cycles / (freq * core_num * task_duration)`。| |
| 433 | 433 | ||
| 434 | > [!NOTE] | 434 | > [!NOTE] |
| 435 | > | 435 | > |
| @@ -580,7 +580,7 @@ op\_summary\_\*.csv文件根据msprof采集参数取值不同,文件呈现结 | |||
| 580 | |fixpipe_exe_time(us)|fixpipe类型指令(L0C->OUT/L1搬运类指令)耗时,单位us。| | 580 | |fixpipe_exe_time(us)|fixpipe类型指令(L0C->OUT/L1搬运类指令)耗时,单位us。| |
| 581 | |fixpipe_exe_ratio|fixpipe类型指令(L0C->OUT/L1搬运类指令)的cycle数在total cycle数中的占用比。| | 581 | |fixpipe_exe_ratio|fixpipe类型指令(L0C->OUT/L1搬运类指令)的cycle数在total cycle数中的占用比。| |
| 582 | |memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。| | 582 | |memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。| |
| 583 | -|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:cube_utilization = total_cycles / (freq * core_num * task_duration)。| | 583 | +|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:`cube_utilization = total_cycles / (freq * core_num * task_duration)`。| |
| 584 | 584 | ||
| 585 | 仅支持产品:Atlas 200I/500 A2 推理产品 | 585 | 仅支持产品:Atlas 200I/500 A2 推理产品 |
| 586 | 586 | ||
| @@ -1180,7 +1180,7 @@ npu\_module\_mem\_\*.csv文件内容格式示例如下: | |||
| 1180 | 1180 | ||
| 1181 | 数据增强信息仅在训练场景下生成且仅生成summary数据dp\_\*.csv。 | 1181 | 数据增强信息仅在训练场景下生成且仅生成summary数据dp\_\*.csv。 |
| 1182 | 1182 | ||
| 1183 | -在TensorFlow训练场景开启数据预处理下沉(即enable\_data\_pre\_proc开关配置为True)时可生成dp\_\*.csv文件。详情请参见《TensorFlow 1.15模型迁移指南》中的“[训练迭代循环下沉](https://www.hiascend.com/document/detail/zh/TensorFlowCommercial/900/migration/tfmigr1/tfmigr1_000048.html)”章节。 | 1183 | +在TensorFlow训练场景开启数据预处理下沉(即enable\_data\_pre\_proc开关配置为True)时可生成dp\_\*.csv文件。详情请参见《TensorFlow 1.15模型迁移指南》中的“[训练迭代循环下沉](https://gitcode.com/cann/tensorflow/blob/master/docs/zh/tfadapter_1/migration/performance_tuning/iteration_offload.md)”章节。 |
| 1184 | 1184 | ||
| 1185 | **产品支持情况<a name="zh-cn_topic_0000001752181593_section91616487538"></a>** | 1185 | **产品支持情况<a name="zh-cn_topic_0000001752181593_section91616487538"></a>** |
| 1186 | 1186 | ||