已合并
docs:CANN相关链接修改 #397
cai-weiwei1989创建于 8月4日
docs:CANN相关链接修改 #397
已合并
cai-weiwei1989创建于 8月4日
3 个文件变更+5-5
@@ -31,7 +31,7 @@
31 31 
322、除此以外,部分流同步业务可能是环境变量引入,例如322、除此以外,部分流同步业务可能是环境变量引入,例如
33 33 
34-[ASCEND_LAUNCH_BLOCKING](https://gitcode.com/Ascend/pytorch/blob/v2.7.1/docs/zh/environment_variable_reference/ASCEND_LAUNCH_BLOCKING.md)34+[ASCEND_LAUNCH_BLOCKING](https://gitcode.com/Ascend/pytorch/blob/master/docs/zh/api/environment_variable/op_execution/ASCEND_LAUNCH_BLOCKING.md)
35就会对每个算子进行流同步,用以定位问题。35就会对每个算子进行流同步,用以定位问题。
36 36 
37# 六、定位方法总结37# 六、定位方法总结
@@ -20,7 +20,7 @@
20 20 
21- 可通过环境变量调整日志等级和输出路径:`export ASCEND_GLOBAL_LOG_LEVEL=0`(设置日志等级),`export ASCEND_PROCESS_LOG_PATH=/path/to/plog`(自定义输出路径)。21- 可通过环境变量调整日志等级和输出路径:`export ASCEND_GLOBAL_LOG_LEVEL=0`(设置日志等级),`export ASCEND_PROCESS_LOG_PATH=/path/to/plog`(自定义输出路径)。
22- 当遇到数据采集失败、host目录为空等问题时,建议优先查看PLOG中的ERROR/WARNING日志以快速定位原因。22- 当遇到数据采集失败、host目录为空等问题时,建议优先查看PLOG中的ERROR/WARNING日志以快速定位原因。
23-- 参考文档:[昇腾环境变量参考](https://www.hiascend.com/document/detail/zh/canncommercial/900/maintenref/envvar/envref_07_0122.html)。23+- 参考文档:[昇腾环境变量参考](https://www.hiascend.com/document/detail/zh/CANNCommunityEdition/latest/maintenref/envvar/envref_07_0001.html)。
24 24 
25- **Q:使用msprof采集算子数据,host目录为空没有数据?**25- **Q:使用msprof采集算子数据,host目录为空没有数据?**
26- A:优先检查Plog报错,可能存在的情况如下:26- A:优先检查Plog报错,可能存在的情况如下:
@@ -429,7 +429,7 @@ op\_summary\_\*.csv文件根据msprof采集参数取值不同,文件呈现结
429|*_mte3_ratio|mte3类型指令(AICORE->DDR搬运类指令)的cycle数在total cycle数中的占用比。|429|*_mte3_ratio|mte3类型指令(AICORE->DDR搬运类指令)的cycle数在total cycle数中的占用比。|
430|*_icache_miss_rate|icache是为instruction预留的L2 Cache,icache_miss_rate数值高代表AI Core读取指令的效率低。|430|*_icache_miss_rate|icache是为instruction预留的L2 Cache,icache_miss_rate数值高代表AI Core读取指令的效率低。|
431|memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。|431|memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。|
432-|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:cube_utilization = total_cycles / (freq * core_num * task_duration)。|432+|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:`cube_utilization = total_cycles / (freq * core_num * task_duration)`。|
433 433 
434> [!NOTE]434> [!NOTE]
435>435>
@@ -580,7 +580,7 @@ op\_summary\_\*.csv文件根据msprof采集参数取值不同,文件呈现结
580|fixpipe_exe_time(us)|fixpipe类型指令(L0C->OUT/L1搬运类指令)耗时,单位us。|580|fixpipe_exe_time(us)|fixpipe类型指令(L0C->OUT/L1搬运类指令)耗时,单位us。|
581|fixpipe_exe_ratio|fixpipe类型指令(L0C->OUT/L1搬运类指令)的cycle数在total cycle数中的占用比。|581|fixpipe_exe_ratio|fixpipe类型指令(L0C->OUT/L1搬运类指令)的cycle数在total cycle数中的占用比。|
582|memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。|582|memory_bound|用于识别AI Core执行算子计算过程是否存在Memory瓶颈,由mte2_ratio/max(mac_ratio, vec_ratio)计算得出。计算结果小于1,表示没有Memory瓶颈;计算结果大于1则表示AI Core在执行Task过程中大部分时间都在做内存搬运而不是计算,且数值越大Memory瓶颈越严重。|
583-|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:cube_utilization = total_cycles / (freq * core_num * task_duration)。|583+|cube_utilization(%)|cube算子利用率,查看cube算子在单位时间内的运算次数是否达到理论上限,越接近于100%则表示越接近理论上限。计算公式:`cube_utilization = total_cycles / (freq * core_num * task_duration)`。|
584 584 
585仅支持产品:Atlas 200I/500 A2 推理产品585仅支持产品:Atlas 200I/500 A2 推理产品
586 586 
@@ -1180,7 +1180,7 @@ npu\_module\_mem\_\*.csv文件内容格式示例如下:
1180 1180 
1181数据增强信息仅在训练场景下生成且仅生成summary数据dp\_\*.csv。1181数据增强信息仅在训练场景下生成且仅生成summary数据dp\_\*.csv。
1182 1182 
1183-在TensorFlow训练场景开启数据预处理下沉(即enable\_data\_pre\_proc开关配置为True)时可生成dp\_\*.csv文件。详情请参见《TensorFlow 1.15模型迁移指南》中的“[训练迭代循环下沉](https://www.hiascend.com/document/detail/zh/TensorFlowCommercial/900/migration/tfmigr1/tfmigr1_000048.html)”章节。1183+在TensorFlow训练场景开启数据预处理下沉(即enable\_data\_pre\_proc开关配置为True)时可生成dp\_\*.csv文件。详情请参见《TensorFlow 1.15模型迁移指南》中的“[训练迭代循环下沉](https://gitcode.com/cann/tensorflow/blob/master/docs/zh/tfadapter_1/migration/performance_tuning/iteration_offload.md)”章节。
1184 1184 
1185**产品支持情况<a name="zh-cn_topic_0000001752181593_section91616487538"></a>**1185**产品支持情况<a name="zh-cn_topic_0000001752181593_section91616487538"></a>**
1186 1186