您好,该问题解决方法可参考https://gitcode.com/Ascend/MindSpeed-LLM/issues/1160
在使用master版本的MindSpeed-LLM时,使用2.2.0分支或2.3.0分支的MindSpeed会出现该报错。
更换MindSpeed到对应的master版本修复该问题。


您好,该问题解决方法可参考https://gitcode.com/Ascend/MindSpeed-LLM/issues/1160
在使用master版本的MindSpeed-LLM时,使用2.2.0分支或2.3.0分支的MindSpeed会出现该报错。
更换MindSpeed到对应的master版本修复该问题。
我用的这个镜像swr.cn-south-1.myhuaweicloud.com/ascendhub/mindspeed-llm:openeuler22.03-mindspeed-llm-2.3.0-a2-arm
但是把默认安装的mindspeed卸载了,重新安装的mindspeed master分支,然后还是有上面的问题
是没有卸载干净吗?


直接把master分支的MindSpeed目录下的mindspeed目录copy到MindSpeed-LLM根目录下试试看


我们仓上当前master分支还没有提供fsdp2 qwen3 14b的脚本,这个是你自己改的吗,有尝试做适配吗。
而且脚本使用的还是fsdp2老框架的风格,当前fsdp2后端已经切换了新框架,后续关于fsdp2的开发和模型适配都在新框架中进行。建议使用新框架完成模型的适配。
虽然该问题应该是mindspeed版本引起的,但是在此之外fsdp2老框架出现的问题我们不能保证一定能够修复,需要您自行尝试解决。


直接把master分支的MindSpeed目录下的mindspeed目录copy到MindSpeed-LLM根目录下试试看
试了,还是一样的



Using /root/.cache/torch_extensions/py310_cpu as PyTorch extensions root...
Traceback (most recent call last):
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/train_fsdp2.py", line 27, in <module>
from mindspeed_llm.fsdp2.models.model_factory import ModelFactory
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed_llm/__init__.py", line 19, in <module>
from mindspeed_llm.tasks import megatron_adaptor_v2 as megatron_adaptor
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed_llm/tasks/megatron_adaptor_v2.py", line 92, in <module>
FeatureAdaptor.execute()
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed_llm/tasks/megatron_adaptor_v2.py", line 84, in execute
MindSpeedFeaturesManager.apply_features_pre_patches(args)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed/features_manager/features_manager.py", line 20, in apply_features_pre_patches
feature.pre_register_patches(MindSpeedPatchesManager, mindspeed_args)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed_llm/features_manager/megatron_basic/requirements_basic.py", line 24, in pre_register_patches
super().pre_register_patches(patch_manager, args)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed/features_manager/megatron_basic/requirements_basic.py", line 24, in pre_register_patches
self.te_adaptation(patch_manager, args)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed/features_manager/megatron_basic/requirements_basic.py", line 32, in te_adaptation
pm.register_patch('torch.compile', dummy_compile)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed/patch_utils.py", line 181, in register_patch
MindSpeedPatchesManager.patches_info.get(orig_func_name).set_patch_func(new_func, force_patch)
File "/home/xxx/dev_exp/FSDP/MindSpeed-LLM/mindspeed/patch_utils.py", line 75, in set_patch_func
raise RuntimeError('the patch of {} exist !'.format(self.orig_func_name))
RuntimeError: the patch of compile exist !


更换到新分支后有更新安装依赖吗,可以重新安装下两个仓库的requirements.txt
然后可以尝试跑一下mcore后端已经跑通过的脚本,如果依旧出现该报错确认是mindspeed引入的。
如果确认是mindspeed引入,可以尝试新建conda环境,重新安装mindspeed解决。


那应该不是mindspeed版本的问题了
建议切换到fsdp2新框架进行新模型的接入,老框架当前已作为废弃方案不再使用。
您可自行尝试接入,或是等待fsdp2模型接入指南文档。该指南预计会在年后编写完成合入,届时可参考指南进行新模型的快速接入。


https://gitcode.com/Ascend/MindSpeed-LLM/blob/master/docs/pytorch/fsdp2/fsdp2_quickstart.md
可以看下这篇快速拉起文档,这篇介绍的就是拉起新fsdp2框架的指导
像老mcore脚本风格的就是老框架的
老框架相关的脚本之后应该会下掉了


https://gitcode.com/Ascend/MindSpeed-LLM/blob/master/docs/pytorch/fsdp2/fsdp2_quickstart.md
可以看下这篇快速拉起文档,这篇介绍的就是拉起新fsdp2框架的指导
像老mcore脚本风格的就是老框架的
老框架相关的脚本之后应该会下掉了
多谢


当前Issue标记为resolved且有一段时间未进一步更新,因此我们将其标记为'stale'(闲置)状态。若你认为这是误操作,可通过添加任意评论来去除'stale'标签。标记为stale的Issue在4天内无更新活动将自动关闭。


如果您目前没有其他问题,我们将根据流程关闭此 issue。
如后续有新的疑问或补充内容,欢迎随时重新打开本 issue,或另起一个新的 issue 进行提问。
感谢您的理解与支持!



在提交新问题之前,请确保您已经在社区中搜索过相关问题,并使用了社区中提供的资源/工具后,仍未找到满意的解决方式。
⚠️ 安全信息提醒:请仔细检查提供的文本内容,确保其不包含敏感数据信息,包括但不限于:
在分享配置信息或代码示例时,请将敏感信息脱敏处理,或使用
<TOKEN>等占位符替代原有内容。环境信息
🐛 问题描述
master分支使用fsdp2拉起qwen3-14b,报错RuntimeError: the patch of compile exist !
训练脚本
欢迎加入社区,感谢您对社区的贡献 🎉!