已关闭
[Feature]: 故障诊断训练前后环境检查脚本新增指标采集 #35
kangfuan创建于 19 天前关闭于 17 天前
xiangjie10
19 天前 评论:
19 天前 评论:
👋 您好,感谢向 mindcluster-deploy 提交 Issue!
🎉 我们已收到您的反馈,感谢你对开源社区的支持!
📅 处理时效 维护团队将在工作日 24 小时内查看并回复您的问题。
🔍 自助排查(推荐优先查看) 在等待回复期间,您可以先查阅仓库README以及历史 Issue 中相似问题的解决方案,多数问题可快速解决。
💡 为了更快定位问题,请您确保 Issue 包含:
- 清晰的问题描述
- 可复现的操作步骤
- 相关日志、截图或环境信息
我们会尽快跟进,感谢您的理解与配合!


xiangjie10
19 天前 评论:
19 天前 评论:
/label add triaged


19 天前 添加了label:triaged
17 天前 关闭了 issue
17 天前 issue状态由 TODO 改变为 DONE
17 天前 添加了label:resolved
提交提案之前,请先检索仓库内是否已有相同的提案,如已有请在同一提案中进行讨论。
💻 需求背景、当前现状、期望实现的功能内容、具体的设计方案、以及测试方案
前提条件:
A5场景下当plog中出现cqe error status[5]时
下一步动作:
要判断此时是否存在网络静默改包问题。需要收集任务前、后的指标,通过hccn_tool -g -stat命令,用于更精确定位ub问题
回显中读取以下四个字段进行判定,只要当某张卡的某个die的某个port查出的这四个指标中其中一个在任务后有增加,则匹配到该故障模式:
rxdma_icrc_err_cnt_queue_id0: 0
rxdma_icrc_err_cnt_queue_id1: 0
rxdma_icrc_err_cnt_queue_id2: 0
rxdma_icrc_err_cnt_queue_id3: 0
处理建议:
此时建议通过hccl-test工具校验数据,结合链路2分排查对应的故障芯片位置
适配方案:
要修改训练前后环境检查的收集脚本
替代方案
补充说明
欢迎加入社区,感谢您对社区的贡献 🎉!