已关闭
[Usage]: 按照官方文档中的quickstart,进行分布式训练qwen25,一直报错:[rank]: [ERROR]2026-03-24-08:08:06 (PID:2217,Device:0,RankID:0)ERRO2200 DIST call hccl api failed. #1257
AstarteJiao创建于 3月24日关闭于 4月13日
3月24日 添加了label:usage
3月24日 添加了label:usage
3月24日 修改了issue 的描述
3月24日 修改了issue 的描述
AstarteJiao
3月25日 评论:
3月25日 评论:
AstarteJiao
3月25日 评论:
3月25日 评论:
z__y
3月30日 评论:
3月30日 评论:
您好,请问您拉起两个机器训练的时候有没有在两个机器上分别改这个rank呢:
两台机器应该一个是0,一个是1,上面的地址应该写rank0的机器的地址
MASTER_ADDR参数写的都是rank0的IP地址,当前镜像用的是mindspeed_rl_2.2.0版本
您好,我们仓库有配套的mindspeed_llm镜像,您使用的mindspeed_rl镜像可能和我们的配置不一样


z__y
3月30日 评论:
3月30日 评论:
您好,请问您拉起两个机器训练的时候有没有在两个机器上分别改这个rank呢:
两台机器应该一个是0,一个是1,上面的地址应该写rank0的机器的地址
MASTER_ADDR参数写的都是rank0的IP地址,当前镜像用的是mindspeed_rl_2.2.0版本
https://gitcode.com/Ascend/MindSpeed-LLM/wiki/MindSpeed-LLM-2.2.0镜像使用指导.md
您好,这是镜像使用说明


3月31日 将 z__y 设为负责人
歪比巴卜
4月13日 评论:
4月13日 评论:
/label add resolved


4月13日 添加了label:resolved
歪比巴卜
4月13日 评论:
4月13日 评论:
如果您目前没有其他问题,我们将根据流程关闭此 issue。
如后续有新的疑问或补充内容,欢迎随时重新打开本 issue,或另起一个新的 issue 进行提问。
感谢您的理解与支持!


4月13日 issue状态由 TODO 改变为 DONE
4月13日 关闭了 issue
dev_zyx
5月18日 评论:
5月18日 评论:
你好,我也遇到了这个问题,请问最终是如何解决啊?



在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。
环境信息
次节点上,分布式训练脚本dis_tune_qwen25_0.5b_lora_ptd.sh内容
报错信息
使用场景及问题
欢迎加入社区,感谢您对社区的贡献 🎉!