已合并
更新使用文档,修复在使用moe模型时忘加配置导致的推理乱码问题 2.3.0 #824
chengminhua创建于 2025年12月11日
更新使用文档,修复在使用moe模型时忘加配置导致的推理乱码问题 2.3.0 #824
已合并
chengminhua创建于 2025年12月11日
已删除 :2.3.0合入到Ascend/MindSpeed-RL2.3.0
4 个文件变更+16-4
Mdocs/algorithms/dapo.md+4-1
@@ -45,7 +45,10 @@ bash examples/data/preprocess_data.sh math_17k
45## 模型权重转换45## 模型权重转换
46 46 
47根据 DAPO 算法要求,Actor 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。DAPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。47根据 DAPO 算法要求,Actor 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。DAPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。
48- 48+```bash
49+#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码)
50+--moe-tp-extend-ep
51+```
49### 环境要求52### 环境要求
50**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**53**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**
51如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。54如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。
Mdocs/algorithms/dpo.md+4-1
@@ -45,7 +45,10 @@ bash examples/data/preprocess_data.sh orca_rlhf
45## 模型权重转换45## 模型权重转换
46 46 
47根据 DPO 算法原理,Actor 和 Reference 模型可以均为同一模型。DPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。47根据 DPO 算法原理,Actor 和 Reference 模型可以均为同一模型。DPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。
48- 48+```bash
49+#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码)
50+--moe-tp-extend-ep
51+```
49### 环境要求52### 环境要求
50**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**53**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**
51如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。54如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。
Mdocs/algorithms/grpo.md+4-1
@@ -63,7 +63,10 @@ bash examples/data/preprocess_data.sh deepscaler
63## 模型权重转换63## 模型权重转换
64 64 
65根据 GRPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。GRPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。65根据 GRPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。GRPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。
66- 66+```bash
67+#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码)
68+--moe-tp-extend-ep
69+```
67### 环境要求70### 环境要求
68**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**71**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**
69如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。72如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。
Mdocs/algorithms/ppo.md+4-1
@@ -51,7 +51,10 @@ bash examples/data/preprocess_data.sh deepscaler
51## 模型权重转换51## 模型权重转换
52 52 
53根据 PPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。PPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。53根据 PPO 算法要求,Actor 和 Reference 模型应该使用 SFT 微调后的模型进行初始化,Reward 模型应该使用规则奖励。PPO 算法模型权重均使用 Megatron-mcore 格式,其他格式的权重需要进行模型权重转换。
54- 54+```bash
55+#注意,MSRL里跑MoE模型默认设置moe_tp_extend_ep为true,转换权重时要加上下面的配置(不加会导致推理乱码)
56+--moe-tp-extend-ep
57+```
55### 环境要求58### 环境要求
56**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**59**权重转换需要安装MindSpeed-LLM,建议在新建虚拟环境中安装,避免和MindSpeed-RL 出现依赖冲突。**
57如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。60如果环境里已有驱动和CANN,具体安装方法参考[“PTA”和“MindSpeed-LLM及相关依赖”安装指南](https://gitcode.com/Ascend/MindSpeed-LLM/blob/2.1.0/docs/pytorch/install_guide.md#pta%E5%AE%89%E8%A3%85)。