已合并
fix: revert online weight conversion support for model scripts that do not support it. #4694
fix: revert online weight conversion support for model scripts that do not support it. #4694
已合并
daixzh创建于 7月4日
21 个文件变更+11-165
Mexamples/mcore/deepseek4_flash/pretrain_deepseek4_flash_4k_A3_ptd.sh+2-9
@@ -1,7 +1,7 @@
1#!/bin/bash1#!/bin/bash
2 2 
3export HCCL_CONNECT_TIMEOUT=36003export HCCL_CONNECT_TIMEOUT=7200
4export HCCL_EXEC_TIMEOUT=36004export HCCL_EXEC_TIMEOUT=7200
5export ACL_DEVICE_SYNC_TIMEOUT=72005export ACL_DEVICE_SYNC_TIMEOUT=7200
6export CUDA_DEVICE_MAX_CONNECTIONS=16export CUDA_DEVICE_MAX_CONNECTIONS=1
7export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True7export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
@@ -194,15 +194,9 @@ GPT_ARGS="
194 194 
195DATA_ARGS="195DATA_ARGS="
196 --data-path $DATA_PATH \196 --data-path $DATA_PATH \
197 --handler-name GeneralPretrainHandler \
198 --split 100,0,0 \197 --split 100,0,0 \
199"198"
200 199 
201CKPT_ARGS="
202 --enable-hf2mg-convert \
203 --model-type-hf deepseek4
204"
205 
206OUTPUT_ARGS="200OUTPUT_ARGS="
207 --log-interval 1 \201 --log-interval 1 \
208 --save $CKPT_SAVE_DIR \202 --save $CKPT_SAVE_DIR \
@@ -225,5 +219,4 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_deepseek4.py \
225 $CA_ARGS \219 $CA_ARGS \
226 $MEM_ARGS \220 $MEM_ARGS \
227 $MTP_ARGS \221 $MTP_ARGS \
228 $CKPT_ARGS \
229 --distributed-backend nccl 2>&1 | tee logs/pretrain_deepseek4_flash_4k_A3_ptd.log222 --distributed-backend nccl 2>&1 | tee logs/pretrain_deepseek4_flash_4k_A3_ptd.log
Mexamples/mcore/deepseek4_flash/tune_deepseek4_flash_4k_A3_ptd.sh+2-9
@@ -1,7 +1,7 @@
1#!/bin/bash1#!/bin/bash
2 2 
3export HCCL_CONNECT_TIMEOUT=36003export HCCL_CONNECT_TIMEOUT=7200
4export HCCL_EXEC_TIMEOUT=36004export HCCL_EXEC_TIMEOUT=7200
5export ACL_DEVICE_SYNC_TIMEOUT=72005export ACL_DEVICE_SYNC_TIMEOUT=7200
6export CUDA_DEVICE_MAX_CONNECTIONS=16export CUDA_DEVICE_MAX_CONNECTIONS=1
7export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True7export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
@@ -194,15 +194,9 @@ GPT_ARGS="
194 194 
195DATA_ARGS="195DATA_ARGS="
196 --data-path $DATA_PATH \196 --data-path $DATA_PATH \
197 --handler-name AlpacaStyleInstructionHandler \
198 --split 100,0,0 \197 --split 100,0,0 \
199"198"
200 199 
201CKPT_ARGS="
202 --enable-hf2mg-convert \
203 --model-type-hf deepseek4
204"
205 
206OUTPUT_ARGS="200OUTPUT_ARGS="
207 --log-interval 1 \201 --log-interval 1 \
208 --save $CKPT_SAVE_DIR \202 --save $CKPT_SAVE_DIR \
@@ -233,5 +227,4 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS posttrain_gpt.py \
233 $MEM_ARGS \227 $MEM_ARGS \
234 $MTP_ARGS \228 $MTP_ARGS \
235 $FINETUNE_ARGS \229 $FINETUNE_ARGS \
236 $CKPT_ARGS \
237 --distributed-backend nccl 2>&1 | tee logs/tune_deepseek4_flash_4k_A3_ptd.log230 --distributed-backend nccl 2>&1 | tee logs/tune_deepseek4_flash_4k_A3_ptd.log
Mexamples/mcore/gemma2/pretrain_gemma2_27b_ptd.sh+0-9
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6NPUS_PER_NODE=84NPUS_PER_NODE=8
@@ -89,15 +87,9 @@ GPT_ARGS="
89 87 
90DATA_ARGS="88DATA_ARGS="
91 --data-path $DATA_PATH \89 --data-path $DATA_PATH \
92 --handler-name GeneralPretrainHandler \
93 --split 100,0,090 --split 100,0,0
94"91"
95 92 
96CKPT_ARGS="
97 --enable-hf2mg-convert \
98 --model-type-hf gemma2
99"
100 
101OUTPUT_ARGS="93OUTPUT_ARGS="
102 --log-interval 1 \94 --log-interval 1 \
103 --save-interval 2000 \95 --save-interval 2000 \
@@ -109,7 +101,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
109 $GPT_ARGS \101 $GPT_ARGS \
110 $DATA_ARGS \102 $DATA_ARGS \
111 $OUTPUT_ARGS \103 $OUTPUT_ARGS \
112 $CKPT_ARGS \
113 --distributed-backend nccl \104 --distributed-backend nccl \
114 --load ${CKPT_LOAD_DIR} \105 --load ${CKPT_LOAD_DIR} \
115 --save ${CKPT_SAVE_DIR} \106 --save ${CKPT_SAVE_DIR} \
Mexamples/mcore/gemma2/pretrain_gemma2_9b_ptd.sh+0-9
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6NPUS_PER_NODE=84NPUS_PER_NODE=8
@@ -88,15 +86,9 @@ GPT_ARGS="
88 86 
89DATA_ARGS="87DATA_ARGS="
90 --data-path $DATA_PATH \88 --data-path $DATA_PATH \
91 --handler-name GeneralPretrainHandler \
92 --split 100,0,089 --split 100,0,0
93"90"
94 91 
95CKPT_ARGS="
96 --enable-hf2mg-convert \
97 --model-type-hf gemma2
98"
99 
100OUTPUT_ARGS="92OUTPUT_ARGS="
101 --log-interval 1 \93 --log-interval 1 \
102 --save-interval 2000 \94 --save-interval 2000 \
@@ -108,7 +100,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
108 $GPT_ARGS \100 $GPT_ARGS \
109 $DATA_ARGS \101 $DATA_ARGS \
110 $OUTPUT_ARGS \102 $OUTPUT_ARGS \
111 $CKPT_ARGS \
112 --distributed-backend nccl \103 --distributed-backend nccl \
113 --load ${CKPT_LOAD_DIR} \104 --load ${CKPT_LOAD_DIR} \
114 --save ${CKPT_SAVE_DIR} \105 --save ${CKPT_SAVE_DIR} \
Mexamples/mcore/gemma2/tune_gemma2_9b_full_ptd.sh+0-10
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4 2 
5export CUDA_DEVICE_MAX_CONNECTIONS=13export CUDA_DEVICE_MAX_CONNECTIONS=1
6 4 
@@ -95,15 +93,9 @@ GPT_ARGS="
95 93 
96DATA_ARGS="94DATA_ARGS="
97 --data-path $DATA_PATH \95 --data-path $DATA_PATH \
98 --handler-name AlpacaStyleInstructionHandler \
99 --split 100,0,096 --split 100,0,0
100"97"
101 98 
102CKPT_ARGS="
103 --enable-hf2mg-convert \
104 --model-type-hf gemma2
105"
106 
107OUTPUT_ARGS="99OUTPUT_ARGS="
108 --log-interval 1 \100 --log-interval 1 \
109 --save-interval 2000 \101 --save-interval 2000 \
@@ -115,10 +107,8 @@ torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \
115 $GPT_ARGS \107 $GPT_ARGS \
116 $DATA_ARGS \108 $DATA_ARGS \
117 $OUTPUT_ARGS \109 $OUTPUT_ARGS \
118 $CKPT_ARGS \
119 --distributed-backend nccl \110 --distributed-backend nccl \
120 --load ${CKPT_LOAD_DIR} \111 --load ${CKPT_LOAD_DIR} \
121 --save ${CKPT_SAVE_DIR} \112 --save ${CKPT_SAVE_DIR} \
122 --transformer-impl local \113 --transformer-impl local \
123 --prompt-type gemma \
124 | tee logs/tune_gemma2_9b_full_ptd.log114 | tee logs/tune_gemma2_9b_full_ptd.log
Mexamples/mcore/glm5/pretrain_glm5_744b_4k_A3_ptd.sh+0-7
@@ -4,7 +4,6 @@ export CUDA_DEVICE_MAX_CONNECTIONS=1
4export CPU_AFFINITY_CONF=14export CPU_AFFINITY_CONF=1
5export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True5export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
6export HCCL_CONNECT_TIMEOUT=36006export HCCL_CONNECT_TIMEOUT=3600
7export HCCL_EXEC_TIMEOUT=3600
8export TASK_QUEUE_ENABLE=27export TASK_QUEUE_ENABLE=2
9export STREAMS_PER_DEVICE=328export STREAMS_PER_DEVICE=32
10export HCCL_IF_BASE_PORT=258099export HCCL_IF_BASE_PORT=25809
@@ -184,7 +183,6 @@ GPT_ARGS="
184 183 
185DATA_ARGS="184DATA_ARGS="
186 --data-path $DATA_PATH \185 --data-path $DATA_PATH \
187 --handler-name GeneralPretrainHandler \
188 --split 100,0,0186 --split 100,0,0
189"187"
190 188 
@@ -198,10 +196,6 @@ OUTPUT_ARGS="
198 --no-save-rng196 --no-save-rng
199"197"
200 198 
201CKPT_ARGS="
202 --enable-hf2mg-convert \
203 --model-type-hf glm5 \
204"
205 199 
206python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \200python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \
207 $GPT_ARGS \201 $GPT_ARGS \
@@ -214,7 +208,6 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \
214 $MOE_ARGS \208 $MOE_ARGS \
215 $PIPELINE_ARGS \209 $PIPELINE_ARGS \
216 $DSA_ARGS \210 $DSA_ARGS \
217 $CKPT_ARGS \
218 ${OTHERS_ARGS[@]} \211 ${OTHERS_ARGS[@]} \
219 --save $CKPT_SAVE_DIR \212 --save $CKPT_SAVE_DIR \
220 --load $CKPT_LOAD_DIR \213 --load $CKPT_LOAD_DIR \
Mexamples/mcore/glm52/pretrain_glm52_744b_4k_A3_ptd.sh+0-6
@@ -189,11 +189,6 @@ DATA_ARGS="
189 --handler-name GeneralPretrainHandler \189 --handler-name GeneralPretrainHandler \
190"190"
191 191 
192CKPT_ARGS="
193 --enable-hf2mg-convert \
194 --model-type-hf glm5
195"
196 
197 192 
198OUTPUT_ARGS="193OUTPUT_ARGS="
199 --log-interval 1 \194 --log-interval 1 \
@@ -214,7 +209,6 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \
214 $MEM_ARGS \209 $MEM_ARGS \
215 $MOE_ARGS \210 $MOE_ARGS \
216 $DSA_ARGS \211 $DSA_ARGS \
217 $CKPT_ARGS \
218 ${OTHERS_ARGS[@]} \212 ${OTHERS_ARGS[@]} \
219 --save $CKPT_SAVE_DIR \213 --save $CKPT_SAVE_DIR \
220 --load $CKPT_LOAD_DIR \214 --load $CKPT_LOAD_DIR \
Mexamples/mcore/longcat/pretrain_longcat_flash_560b_4k_A3_ptd.sh+2-9
@@ -1,6 +1,6 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=36002export HCCL_CONNECT_TIMEOUT=6000
3export HCCL_EXEC_TIMEOUT=36003export HCCL_EXEC_TIMEOUT=5400
4export HCCL_IF_BASE_PORT=488904export HCCL_IF_BASE_PORT=48890
5export CUDA_DEVICE_MAX_CONNECTIONS=15export CUDA_DEVICE_MAX_CONNECTIONS=1
6export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True6export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
@@ -138,15 +138,9 @@ GPT_ARGS="
138 138 
139DATA_ARGS="139DATA_ARGS="
140 --data-path $DATA_PATH \140 --data-path $DATA_PATH \
141 --handler-name GeneralPretrainHandler \
142 --split 100,0,0141 --split 100,0,0
143"142"
144 143 
145CKPT_ARGS="
146 --enable-hf2mg-convert \
147 --model-type-hf longcat
148"
149 
150OUTPUT_ARGS="144OUTPUT_ARGS="
151 --log-interval 1 \145 --log-interval 1 \
152 --save-interval ${TRAIN_ITERS} \146 --save-interval ${TRAIN_ITERS} \
@@ -162,7 +156,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
162 $MOE_ARGS \156 $MOE_ARGS \
163 $MLA_ARGS \157 $MLA_ARGS \
164 $OUTPUT_ARGS \158 $OUTPUT_ARGS \
165 $CKPT_ARGS \
166 $OPTIMIZE_ARGS \159 $OPTIMIZE_ARGS \
167 $TRAIN_ARGS \160 $TRAIN_ARGS \
168 $MODEL_PARALLEL_ARGS \161 $MODEL_PARALLEL_ARGS \
Mexamples/mcore/phi35/pretrain_phi35_mini_A3_ptd.sh+0-9
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6# distributed config4# distributed config
@@ -86,7 +84,6 @@ GPT_ARGS="
86 84 
87DATA_ARGS="85DATA_ARGS="
88 --data-path $DATA_PATH \86 --data-path $DATA_PATH \
89 --handler-name GeneralPretrainHandler \
90 --split 100,0,087 --split 100,0,0
91"88"
92 89 
@@ -97,16 +94,10 @@ OUTPUT_ARGS="
97 --eval-iters 0 \94 --eval-iters 0 \
98"95"
99 96 
100CKPT_ARGS="
101 --enable-hf2mg-convert \
102 --model-type-hf phi3.5
103"
104 
105torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \97torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
106 $GPT_ARGS \98 $GPT_ARGS \
107 $DATA_ARGS \99 $DATA_ARGS \
108 $OUTPUT_ARGS \100 $OUTPUT_ARGS \
109 $CKPT_ARGS \
110 --distributed-backend nccl \101 --distributed-backend nccl \
111 --load ${CKPT_LOAD_DIR} \102 --load ${CKPT_LOAD_DIR} \
112 --save ${CKPT_SAVE_DIR} \103 --save ${CKPT_SAVE_DIR} \
Mexamples/mcore/phi35/pretrain_phi35_moe_ptd.sh+0-9
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6# Change for multinode config4# Change for multinode config
@@ -125,7 +123,6 @@ TRAIN_ARGS="
125 123 
126DATA_ARGS="124DATA_ARGS="
127 --data-path $DATA_PATH \125 --data-path $DATA_PATH \
128 --handler-name GeneralPretrainHandler \
129 --split 100,0,0126 --split 100,0,0
130"127"
131 128 
@@ -137,11 +134,6 @@ OUTPUT_ARGS="
137 --eval-iters 0134 --eval-iters 0
138"135"
139 136 
140CKPT_ARGS="
141 --enable-hf2mg-convert \
142 --model-type-hf phi3.5
143"
144 
145torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \137torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
146 $MOE_ARGS \138 $MOE_ARGS \
147 $GPT_ARGS \139 $GPT_ARGS \
@@ -149,7 +141,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
149 $TRAIN_ARGS \141 $TRAIN_ARGS \
150 $DATA_ARGS \142 $DATA_ARGS \
151 $OUTPUT_ARGS \143 $OUTPUT_ARGS \
152 $CKPT_ARGS \
153 --distributed-backend nccl \144 --distributed-backend nccl \
154 --load ${CKPT_LOAD_DIR} \145 --load ${CKPT_LOAD_DIR} \
155 --save ${CKPT_SAVE_DIR} \146 --save ${CKPT_SAVE_DIR} \
Mexamples/mcore/plm/pretrain_plm_1point8b_ptd.sh+1-9
@@ -1,6 +1,5 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=36002export HCCL_CONNECT_TIMEOUT=1800
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=13export CUDA_DEVICE_MAX_CONNECTIONS=1
5export NPU_ASD_ENABLE=04export NPU_ASD_ENABLE=0
6export HCCL_BUFFSIZE=645export HCCL_BUFFSIZE=64
@@ -99,7 +98,6 @@ GPT_ARGS="
99 98 
100DATA_ARGS="99DATA_ARGS="
101 --data-path $DATA_PATH \100 --data-path $DATA_PATH \
102 --handler-name GeneralPretrainHandler \
103 --split 100,0,0101 --split 100,0,0
104"102"
105 103 
@@ -112,16 +110,10 @@ OUTPUT_ARGS="
112 --no-save-rng110 --no-save-rng
113"111"
114 112 
115CKPT_ARGS="
116 --enable-hf2mg-convert \
117 --model-type-hf plm
118"
119 
120python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \113python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \
121 $GPT_ARGS \114 $GPT_ARGS \
122 $DATA_ARGS \115 $DATA_ARGS \
123 $OUTPUT_ARGS \116 $OUTPUT_ARGS \
124 $CKPT_ARGS \
125 $MLA_ARGS \117 $MLA_ARGS \
126 $ROPE_ARGS \118 $ROPE_ARGS \
127 --distributed-backend nccl \119 --distributed-backend nccl \
Mexamples/mcore/plm/tune_plm_1point8b_full_ptd.sh+0-9
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True3export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
6 4 
@@ -107,7 +105,6 @@ GPT_ARGS="
107 105 
108DATA_ARGS="106DATA_ARGS="
109 --data-path $DATA_PATH \107 --data-path $DATA_PATH \
110 --handler-name AlpacaStyleInstructionHandler \
111 --split 100,0,0108 --split 100,0,0
112"109"
113 110 
@@ -120,16 +117,10 @@ OUTPUT_ARGS="
120 --no-save-rng117 --no-save-rng
121"118"
122 119 
123CKPT_ARGS="
124 --enable-hf2mg-convert \
125 --model-type-hf plm
126"
127 
128torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \120torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \
129 $GPT_ARGS \121 $GPT_ARGS \
130 $DATA_ARGS \122 $DATA_ARGS \
131 $OUTPUT_ARGS \123 $OUTPUT_ARGS \
132 $CKPT_ARGS \
133 $MLA_ARGS \124 $MLA_ARGS \
134 $ROPE_ARGS \125 $ROPE_ARGS \
135 $FITUNE_ARGS \126 $FITUNE_ARGS \
Mexamples/mcore/qwen25/pretrain_qwen25_72b_32k_ptd.sh+1-9
@@ -1,8 +1,7 @@
1#!/bin/bash1#!/bin/bash
2 2 
3export CUDA_DEVICE_MAX_CONNECTIONS=13export CUDA_DEVICE_MAX_CONNECTIONS=1
4export HCCL_CONNECT_TIMEOUT=36004export HCCL_CONNECT_TIMEOUT=1800
5export HCCL_EXEC_TIMEOUT=3600
6 5 
7NPUS_PER_NODE=86NPUS_PER_NODE=8
8MASTER_ADDR=localhost7MASTER_ADDR=localhost
@@ -97,15 +96,9 @@ GPT_ARGS="
97 96 
98DATA_ARGS="97DATA_ARGS="
99 --data-path $DATA_PATH \98 --data-path $DATA_PATH \
100 --handler-name GeneralPretrainHandler \
101 --split 100,0,099 --split 100,0,0
102"100"
103 101 
104CKPT_ARGS="
105 --enable-hf2mg-convert \
106 --model-type-hf llama2
107"
108 
109OUTPUT_ARGS="102OUTPUT_ARGS="
110 --log-interval 1 \103 --log-interval 1 \
111 --save-interval 2000 \104 --save-interval 2000 \
@@ -117,7 +110,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
117 $GPT_ARGS \110 $GPT_ARGS \
118 $DATA_ARGS \111 $DATA_ARGS \
119 $OUTPUT_ARGS \112 $OUTPUT_ARGS \
120 $CKPT_ARGS \
121 --load ${CKPT_LOAD_DIR} \113 --load ${CKPT_LOAD_DIR} \
122 --save ${CKPT_SAVE_DIR} \114 --save ${CKPT_SAVE_DIR} \
123 --log-throughput \115 --log-throughput \
Mexamples/mcore/qwen25/pretrain_qwen25_72b_4k_pack.sh+1-9
@@ -1,7 +1,6 @@
1#!/bin/bash1#!/bin/bash
2export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
3export HCCL_CONNECT_TIMEOUT=36003export HCCL_CONNECT_TIMEOUT=1800
4export HCCL_EXEC_TIMEOUT=3600
5 4 
6NPUS_PER_NODE=85NPUS_PER_NODE=8
7MASTER_ADDR=localhost6MASTER_ADDR=localhost
@@ -99,15 +98,9 @@ GPT_ARGS="
99 98 
100DATA_ARGS="99DATA_ARGS="
101 --data-path $DATA_PATH \100 --data-path $DATA_PATH \
102 --handler-name GeneralPretrainHandler \
103 --split 100,0,0101 --split 100,0,0
104"102"
105 103 
106CKPT_ARGS="
107 --enable-hf2mg-convert \
108 --model-type-hf llama2
109"
110 
111OUTPUT_ARGS="104OUTPUT_ARGS="
112 --log-interval 1 \105 --log-interval 1 \
113 --save-interval 2000 \106 --save-interval 2000 \
@@ -119,7 +112,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
119 $GPT_ARGS \112 $GPT_ARGS \
120 $DATA_ARGS \113 $DATA_ARGS \
121 $OUTPUT_ARGS \114 $OUTPUT_ARGS \
122 $CKPT_ARGS \
123 --load ${CKPT_LOAD_DIR} \115 --load ${CKPT_LOAD_DIR} \
124 --save ${CKPT_SAVE_DIR} \116 --save ${CKPT_SAVE_DIR} \
125 --log-throughput \117 --log-throughput \
Mexamples/mcore/qwen25/pretrain_qwen25_72b_4k_pack_A3.sh+1-9
@@ -1,7 +1,6 @@
1#!/bin/bash1#!/bin/bash
2export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
3export HCCL_CONNECT_TIMEOUT=36003export HCCL_CONNECT_TIMEOUT=1800
4export HCCL_EXEC_TIMEOUT=3600
5 4 
6NPUS_PER_NODE=165NPUS_PER_NODE=16
7MASTER_ADDR=localhost6MASTER_ADDR=localhost
@@ -95,15 +94,9 @@ GPT_ARGS="
95 94 
96DATA_ARGS="95DATA_ARGS="
97 --data-path $DATA_PATH \96 --data-path $DATA_PATH \
98 --handler-name GeneralPretrainHandler \
99 --split 100,0,097 --split 100,0,0
100"98"
101 99 
102CKPT_ARGS="
103 --enable-hf2mg-convert \
104 --model-type-hf llama2
105"
106 
107OUTPUT_ARGS="100OUTPUT_ARGS="
108 --log-interval 1 \101 --log-interval 1 \
109 --save-interval 2000 \102 --save-interval 2000 \
@@ -115,7 +108,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
115 $GPT_ARGS \108 $GPT_ARGS \
116 $DATA_ARGS \109 $DATA_ARGS \
117 $OUTPUT_ARGS \110 $OUTPUT_ARGS \
118 $CKPT_ARGS \
119 --load ${CKPT_LOAD_DIR} \111 --load ${CKPT_LOAD_DIR} \
120 --save ${CKPT_SAVE_DIR} \112 --save ${CKPT_SAVE_DIR} \
121 --log-throughput \113 --log-throughput \
Mexamples/mcore/qwen25/pretrain_qwen25_72b_8k_pack_ptd.sh+1-9
@@ -1,7 +1,6 @@
1#!/bin/bash1#!/bin/bash
2export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
3export HCCL_CONNECT_TIMEOUT=36003export HCCL_CONNECT_TIMEOUT=1800
4export HCCL_EXEC_TIMEOUT=3600
5 4 
6NPUS_PER_NODE=85NPUS_PER_NODE=8
7MASTER_ADDR=localhost6MASTER_ADDR=localhost
@@ -95,15 +94,9 @@ GPT_ARGS="
95 94 
96DATA_ARGS="95DATA_ARGS="
97 --data-path $DATA_PATH \96 --data-path $DATA_PATH \
98 --handler-name GeneralPretrainHandler \
99 --split 100,0,097 --split 100,0,0
100"98"
101 99 
102CKPT_ARGS="
103 --enable-hf2mg-convert \
104 --model-type-hf llama2
105"
106 
107OUTPUT_ARGS="100OUTPUT_ARGS="
108 --log-interval 1 \101 --log-interval 1 \
109 --save-interval 2000 \102 --save-interval 2000 \
@@ -115,7 +108,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \
115 $GPT_ARGS \108 $GPT_ARGS \
116 $DATA_ARGS \109 $DATA_ARGS \
117 $OUTPUT_ARGS \110 $OUTPUT_ARGS \
118 $CKPT_ARGS \
119 --load ${CKPT_LOAD_DIR} \111 --load ${CKPT_LOAD_DIR} \
120 --save ${CKPT_SAVE_DIR} \112 --save ${CKPT_SAVE_DIR} \
121 --log-throughput \113 --log-throughput \
Mexamples/mcore/qwen25/tune_qwen25_72b_16k_full_pack.sh+0-5
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6NPUS_PER_NODE=84NPUS_PER_NODE=8
@@ -106,7 +104,6 @@ GPT_ARGS="
106 104 
107DATA_ARGS="105DATA_ARGS="
108 --data-path $DATA_PATH \106 --data-path $DATA_PATH \
109 --handler-name AlpacaStyleInstructionHandler \
110 --split 100,0,0107 --split 100,0,0
111"108"
112 109 
@@ -116,8 +113,6 @@ CKPT_ARGS="
116 --no-save-optim \113 --no-save-optim \
117 --no-save-rng \114 --no-save-rng \
118 --seed 1234 \115 --seed 1234 \
119 --enable-hf2mg-convert \
120 --model-type-hf llama2
121"116"
122 117 
123OUTPUT_ARGS="118OUTPUT_ARGS="
Mexamples/mcore/qwen25/tune_qwen25_72b_32k_full_pack.sh+0-5
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6NPUS_PER_NODE=164NPUS_PER_NODE=16
@@ -106,7 +104,6 @@ GPT_ARGS="
106 104 
107DATA_ARGS="105DATA_ARGS="
108 --data-path $DATA_PATH \106 --data-path $DATA_PATH \
109 --handler-name AlpacaStyleInstructionHandler \
110 --split 100,0,0107 --split 100,0,0
111"108"
112 109 
@@ -116,8 +113,6 @@ CKPT_ARGS="
116 --no-save-optim \113 --no-save-optim \
117 --no-save-rng \114 --no-save-rng \
118 --seed 1234 \115 --seed 1234 \
119 --enable-hf2mg-convert \
120 --model-type-hf llama2
121"116"
122 117 
123OUTPUT_ARGS="118OUTPUT_ARGS="
Mexamples/mcore/qwen25/tune_qwen25_72b_4k_full_pack.sh+0-5
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5 3 
6NPUS_PER_NODE=84NPUS_PER_NODE=8
@@ -99,7 +97,6 @@ GPT_ARGS="
99 97 
100DATA_ARGS="98DATA_ARGS="
101 --data-path $DATA_PATH \99 --data-path $DATA_PATH \
102 --handler-name AlpacaStyleInstructionHandler \
103 --split 100,0,0100 --split 100,0,0
104"101"
105 102 
@@ -109,8 +106,6 @@ CKPT_ARGS="
109 --no-save-optim \106 --no-save-optim \
110 --no-save-rng \107 --no-save-rng \
111 --seed 1234 \108 --seed 1234 \
112 --enable-hf2mg-convert \
113 --model-type-hf llama2
114"109"
115 110 
116OUTPUT_ARGS="111OUTPUT_ARGS="
Mexamples/mcore/qwen25/tune_qwen25_72b_4k_full_ptd.sh+0-5
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True3export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
6 4 
@@ -107,7 +105,6 @@ GPT_ARGS="
107 105 
108DATA_ARGS="106DATA_ARGS="
109 --data-path $DATA_PATH \107 --data-path $DATA_PATH \
110 --handler-name AlpacaStyleInstructionHandler \
111 --split 100,0,0108 --split 100,0,0
112"109"
113 110 
@@ -117,8 +114,6 @@ CKPT_ARGS="
117 --no-save-optim \114 --no-save-optim \
118 --no-save-rng \115 --no-save-rng \
119 --seed 1234 \116 --seed 1234 \
120 --enable-hf2mg-convert \
121 --model-type-hf llama2
122"117"
123 118 
124OUTPUT_ARGS="119OUTPUT_ARGS="
Mexamples/mcore/qwen25/tune_qwen25_72b_4k_lora_ptd.sh+0-5
@@ -1,6 +1,4 @@
1#!/bin/bash1#!/bin/bash
2export HCCL_CONNECT_TIMEOUT=3600
3export HCCL_EXEC_TIMEOUT=3600
4export CUDA_DEVICE_MAX_CONNECTIONS=12export CUDA_DEVICE_MAX_CONNECTIONS=1
5export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True3export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
6 4 
@@ -104,7 +102,6 @@ GPT_ARGS="
104 102 
105DATA_ARGS="103DATA_ARGS="
106 --data-path $DATA_PATH \104 --data-path $DATA_PATH \
107 --handler-name AlpacaStyleInstructionHandler \
108 --split 100,0,0105 --split 100,0,0
109"106"
110 107 
@@ -114,8 +111,6 @@ CKPT_ARGS="
114 --no-save-optim \111 --no-save-optim \
115 --no-save-rng \112 --no-save-rng \
116 --seed 1234 \113 --seed 1234 \
117 --enable-hf2mg-convert \
118 --model-type-hf llama2
119"114"
120 115 
121OUTPUT_ARGS="116OUTPUT_ARGS="