已合并
更新使用文档,修复在使用moe模型时忘加配置导致的推理乱码问题 2.3.0 #824
chengminhua创建于 2025年12月11日
更新使用文档,修复在使用moe模型时忘加配置导致的推理乱码问题 2.3.0 #824
已合并
从已删除 :2.3.0合入到Ascend/MindSpeed-RL2.3.0
共 4 个文件变更+16-4
| @@ -45,7 +45,10 @@ bash examples/data/preprocess_data.sh math_17k | |||
| 45 | ## 模型权重转换 | 45 | ## 模型权重转换 |
| 46 | 46 | ||
| 47 | 根据 DAPO 算法要求,Actor 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。DAPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 | 47 | 根据 DAPO 算法要求,Actor 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。DAPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 |
| 48 | - | 48 | +```bash |
| 49 | +#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码) | ||
| 50 | +--moe-tp-extend-ep | ||
| 51 | +``` | ||
| 49 | ### 环境要求 | 52 | ### 环境要求 |
| 50 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** | 53 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** |
| 51 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 | 54 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 |
| @@ -45,7 +45,10 @@ bash examples/data/preprocess_data.sh orca_rlhf | |||
| 45 | ## 模型权重转换 | 45 | ## 模型权重转换 |
| 46 | 46 | ||
| 47 | 根据 DPO 算法原理,Actor 和 Reference 模型可以均为同一模型。DPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 | 47 | 根据 DPO 算法原理,Actor 和 Reference 模型可以均为同一模型。DPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 |
| 48 | - | 48 | +```bash |
| 49 | +#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码) | ||
| 50 | +--moe-tp-extend-ep | ||
| 51 | +``` | ||
| 49 | ### 环境要求 | 52 | ### 环境要求 |
| 50 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** | 53 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** |
| 51 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 | 54 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 |
| @@ -63,7 +63,10 @@ bash examples/data/preprocess_data.sh deepscaler | |||
| 63 | ## 模型权重转换 | 63 | ## 模型权重转换 |
| 64 | 64 | ||
| 65 | 根据 GRPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。GRPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 | 65 | 根据 GRPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。GRPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 |
| 66 | - | 66 | +```bash |
| 67 | +#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码) | ||
| 68 | +--moe-tp-extend-ep | ||
| 69 | +``` | ||
| 67 | ### 环境要求 | 70 | ### 环境要求 |
| 68 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** | 71 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** |
| 69 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 | 72 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 |
| @@ -51,7 +51,10 @@ bash examples/data/preprocess_data.sh deepscaler | |||
| 51 | ## 模型权重转换 | 51 | ## 模型权重转换 |
| 52 | 52 | ||
| 53 | 根据 PPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。PPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 | 53 | 根据 PPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。PPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。 |
| 54 | - | 54 | +```bash |
| 55 | +#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码) | ||
| 56 | +--moe-tp-extend-ep | ||
| 57 | +``` | ||
| 55 | ### 环境要求 | 58 | ### 环境要求 |
| 56 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** | 59 | **权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。** |
| 57 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 | 60 | 如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。 |