已合并
fix: revert online weight conversion support for model scripts that do not support it. #4694
daixzh创建于 7月4日
fix: revert online weight conversion support for model scripts that do not support it. #4694
已合并
共 21 个文件变更+11-165
| @@ -1,7 +1,7 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | 2 | ||
| 3 | export HCCL_CONNECT_TIMEOUT=3600 | 3 | export HCCL_CONNECT_TIMEOUT=7200 |
| 4 | export HCCL_EXEC_TIMEOUT=3600 | 4 | export HCCL_EXEC_TIMEOUT=7200 |
| 5 | export ACL_DEVICE_SYNC_TIMEOUT=7200 | 5 | export ACL_DEVICE_SYNC_TIMEOUT=7200 |
| 6 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 6 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 7 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 7 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| @@ -194,15 +194,9 @@ GPT_ARGS=" | |||
| 194 | 194 | ||
| 195 | DATA_ARGS=" | 195 | DATA_ARGS=" |
| 196 | --data-path $DATA_PATH \ | 196 | --data-path $DATA_PATH \ |
| 197 | --handler-name GeneralPretrainHandler \ | ||
| 198 | --split 100,0,0 \ | 197 | --split 100,0,0 \ |
| 199 | " | 198 | " |
| 200 | 199 | ||
| 201 | CKPT_ARGS=" | ||
| 202 | --enable-hf2mg-convert \ | ||
| 203 | --model-type-hf deepseek4 | ||
| 204 | " | ||
| 205 | |||
| 206 | OUTPUT_ARGS=" | 200 | OUTPUT_ARGS=" |
| 207 | --log-interval 1 \ | 201 | --log-interval 1 \ |
| 208 | --save $CKPT_SAVE_DIR \ | 202 | --save $CKPT_SAVE_DIR \ |
| @@ -225,5 +219,4 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_deepseek4.py \ | |||
| 225 | $CA_ARGS \ | 219 | $CA_ARGS \ |
| 226 | $MEM_ARGS \ | 220 | $MEM_ARGS \ |
| 227 | $MTP_ARGS \ | 221 | $MTP_ARGS \ |
| 228 | $CKPT_ARGS \ | ||
| 229 | --distributed-backend nccl 2>&1 | tee logs/pretrain_deepseek4_flash_4k_A3_ptd.log | 222 | --distributed-backend nccl 2>&1 | tee logs/pretrain_deepseek4_flash_4k_A3_ptd.log |
| @@ -1,7 +1,7 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | 2 | ||
| 3 | export HCCL_CONNECT_TIMEOUT=3600 | 3 | export HCCL_CONNECT_TIMEOUT=7200 |
| 4 | export HCCL_EXEC_TIMEOUT=3600 | 4 | export HCCL_EXEC_TIMEOUT=7200 |
| 5 | export ACL_DEVICE_SYNC_TIMEOUT=7200 | 5 | export ACL_DEVICE_SYNC_TIMEOUT=7200 |
| 6 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 6 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 7 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 7 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| @@ -194,15 +194,9 @@ GPT_ARGS=" | |||
| 194 | 194 | ||
| 195 | DATA_ARGS=" | 195 | DATA_ARGS=" |
| 196 | --data-path $DATA_PATH \ | 196 | --data-path $DATA_PATH \ |
| 197 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 198 | --split 100,0,0 \ | 197 | --split 100,0,0 \ |
| 199 | " | 198 | " |
| 200 | 199 | ||
| 201 | CKPT_ARGS=" | ||
| 202 | --enable-hf2mg-convert \ | ||
| 203 | --model-type-hf deepseek4 | ||
| 204 | " | ||
| 205 | |||
| 206 | OUTPUT_ARGS=" | 200 | OUTPUT_ARGS=" |
| 207 | --log-interval 1 \ | 201 | --log-interval 1 \ |
| 208 | --save $CKPT_SAVE_DIR \ | 202 | --save $CKPT_SAVE_DIR \ |
| @@ -233,5 +227,4 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS posttrain_gpt.py \ | |||
| 233 | $MEM_ARGS \ | 227 | $MEM_ARGS \ |
| 234 | $MTP_ARGS \ | 228 | $MTP_ARGS \ |
| 235 | $FINETUNE_ARGS \ | 229 | $FINETUNE_ARGS \ |
| 236 | $CKPT_ARGS \ | ||
| 237 | --distributed-backend nccl 2>&1 | tee logs/tune_deepseek4_flash_4k_A3_ptd.log | 230 | --distributed-backend nccl 2>&1 | tee logs/tune_deepseek4_flash_4k_A3_ptd.log |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | NPUS_PER_NODE=8 | 4 | NPUS_PER_NODE=8 |
| @@ -89,15 +87,9 @@ GPT_ARGS=" | |||
| 89 | 87 | ||
| 90 | DATA_ARGS=" | 88 | DATA_ARGS=" |
| 91 | --data-path $DATA_PATH \ | 89 | --data-path $DATA_PATH \ |
| 92 | --handler-name GeneralPretrainHandler \ | ||
| 93 | --split 100,0,0 | 90 | --split 100,0,0 |
| 94 | " | 91 | " |
| 95 | 92 | ||
| 96 | CKPT_ARGS=" | ||
| 97 | --enable-hf2mg-convert \ | ||
| 98 | --model-type-hf gemma2 | ||
| 99 | " | ||
| 100 | |||
| 101 | OUTPUT_ARGS=" | 93 | OUTPUT_ARGS=" |
| 102 | --log-interval 1 \ | 94 | --log-interval 1 \ |
| 103 | --save-interval 2000 \ | 95 | --save-interval 2000 \ |
| @@ -109,7 +101,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 109 | $GPT_ARGS \ | 101 | $GPT_ARGS \ |
| 110 | $DATA_ARGS \ | 102 | $DATA_ARGS \ |
| 111 | $OUTPUT_ARGS \ | 103 | $OUTPUT_ARGS \ |
| 112 | $CKPT_ARGS \ | ||
| 113 | --distributed-backend nccl \ | 104 | --distributed-backend nccl \ |
| 114 | --load ${CKPT_LOAD_DIR} \ | 105 | --load ${CKPT_LOAD_DIR} \ |
| 115 | --save ${CKPT_SAVE_DIR} \ | 106 | --save ${CKPT_SAVE_DIR} \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | NPUS_PER_NODE=8 | 4 | NPUS_PER_NODE=8 |
| @@ -88,15 +86,9 @@ GPT_ARGS=" | |||
| 88 | 86 | ||
| 89 | DATA_ARGS=" | 87 | DATA_ARGS=" |
| 90 | --data-path $DATA_PATH \ | 88 | --data-path $DATA_PATH \ |
| 91 | --handler-name GeneralPretrainHandler \ | ||
| 92 | --split 100,0,0 | 89 | --split 100,0,0 |
| 93 | " | 90 | " |
| 94 | 91 | ||
| 95 | CKPT_ARGS=" | ||
| 96 | --enable-hf2mg-convert \ | ||
| 97 | --model-type-hf gemma2 | ||
| 98 | " | ||
| 99 | |||
| 100 | OUTPUT_ARGS=" | 92 | OUTPUT_ARGS=" |
| 101 | --log-interval 1 \ | 93 | --log-interval 1 \ |
| 102 | --save-interval 2000 \ | 94 | --save-interval 2000 \ |
| @@ -108,7 +100,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 108 | $GPT_ARGS \ | 100 | $GPT_ARGS \ |
| 109 | $DATA_ARGS \ | 101 | $DATA_ARGS \ |
| 110 | $OUTPUT_ARGS \ | 102 | $OUTPUT_ARGS \ |
| 111 | $CKPT_ARGS \ | ||
| 112 | --distributed-backend nccl \ | 103 | --distributed-backend nccl \ |
| 113 | --load ${CKPT_LOAD_DIR} \ | 104 | --load ${CKPT_LOAD_DIR} \ |
| 114 | --save ${CKPT_SAVE_DIR} \ | 105 | --save ${CKPT_SAVE_DIR} \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | 2 | ||
| 5 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 3 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 6 | 4 | ||
| @@ -95,15 +93,9 @@ GPT_ARGS=" | |||
| 95 | 93 | ||
| 96 | DATA_ARGS=" | 94 | DATA_ARGS=" |
| 97 | --data-path $DATA_PATH \ | 95 | --data-path $DATA_PATH \ |
| 98 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 99 | --split 100,0,0 | 96 | --split 100,0,0 |
| 100 | " | 97 | " |
| 101 | 98 | ||
| 102 | CKPT_ARGS=" | ||
| 103 | --enable-hf2mg-convert \ | ||
| 104 | --model-type-hf gemma2 | ||
| 105 | " | ||
| 106 | |||
| 107 | OUTPUT_ARGS=" | 99 | OUTPUT_ARGS=" |
| 108 | --log-interval 1 \ | 100 | --log-interval 1 \ |
| 109 | --save-interval 2000 \ | 101 | --save-interval 2000 \ |
| @@ -115,10 +107,8 @@ torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \ | |||
| 115 | $GPT_ARGS \ | 107 | $GPT_ARGS \ |
| 116 | $DATA_ARGS \ | 108 | $DATA_ARGS \ |
| 117 | $OUTPUT_ARGS \ | 109 | $OUTPUT_ARGS \ |
| 118 | $CKPT_ARGS \ | ||
| 119 | --distributed-backend nccl \ | 110 | --distributed-backend nccl \ |
| 120 | --load ${CKPT_LOAD_DIR} \ | 111 | --load ${CKPT_LOAD_DIR} \ |
| 121 | --save ${CKPT_SAVE_DIR} \ | 112 | --save ${CKPT_SAVE_DIR} \ |
| 122 | --transformer-impl local \ | 113 | --transformer-impl local \ |
| 123 | --prompt-type gemma \ | ||
| 124 | | tee logs/tune_gemma2_9b_full_ptd.log | 114 | | tee logs/tune_gemma2_9b_full_ptd.log |
| @@ -4,7 +4,6 @@ export CUDA_DEVICE_MAX_CONNECTIONS=1 | |||
| 4 | export CPU_AFFINITY_CONF=1 | 4 | export CPU_AFFINITY_CONF=1 |
| 5 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 5 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| 6 | export HCCL_CONNECT_TIMEOUT=3600 | 6 | export HCCL_CONNECT_TIMEOUT=3600 |
| 7 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 8 | export TASK_QUEUE_ENABLE=2 | 7 | export TASK_QUEUE_ENABLE=2 |
| 9 | export STREAMS_PER_DEVICE=32 | 8 | export STREAMS_PER_DEVICE=32 |
| 10 | export HCCL_IF_BASE_PORT=25809 | 9 | export HCCL_IF_BASE_PORT=25809 |
| @@ -184,7 +183,6 @@ GPT_ARGS=" | |||
| 184 | 183 | ||
| 185 | DATA_ARGS=" | 184 | DATA_ARGS=" |
| 186 | --data-path $DATA_PATH \ | 185 | --data-path $DATA_PATH \ |
| 187 | --handler-name GeneralPretrainHandler \ | ||
| 188 | --split 100,0,0 | 186 | --split 100,0,0 |
| 189 | " | 187 | " |
| 190 | 188 | ||
| @@ -198,10 +196,6 @@ OUTPUT_ARGS=" | |||
| 198 | --no-save-rng | 196 | --no-save-rng |
| 199 | " | 197 | " |
| 200 | 198 | ||
| 201 | CKPT_ARGS=" | ||
| 202 | --enable-hf2mg-convert \ | ||
| 203 | --model-type-hf glm5 \ | ||
| 204 | " | ||
| 205 | 199 | ||
| 206 | python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ | 200 | python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ |
| 207 | $GPT_ARGS \ | 201 | $GPT_ARGS \ |
| @@ -214,7 +208,6 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 214 | $MOE_ARGS \ | 208 | $MOE_ARGS \ |
| 215 | $PIPELINE_ARGS \ | 209 | $PIPELINE_ARGS \ |
| 216 | $DSA_ARGS \ | 210 | $DSA_ARGS \ |
| 217 | $CKPT_ARGS \ | ||
| 218 | ${OTHERS_ARGS[@]} \ | 211 | ${OTHERS_ARGS[@]} \ |
| 219 | --save $CKPT_SAVE_DIR \ | 212 | --save $CKPT_SAVE_DIR \ |
| 220 | --load $CKPT_LOAD_DIR \ | 213 | --load $CKPT_LOAD_DIR \ |
| @@ -189,11 +189,6 @@ DATA_ARGS=" | |||
| 189 | --handler-name GeneralPretrainHandler \ | 189 | --handler-name GeneralPretrainHandler \ |
| 190 | " | 190 | " |
| 191 | 191 | ||
| 192 | CKPT_ARGS=" | ||
| 193 | --enable-hf2mg-convert \ | ||
| 194 | --model-type-hf glm5 | ||
| 195 | " | ||
| 196 | |||
| 197 | 192 | ||
| 198 | OUTPUT_ARGS=" | 193 | OUTPUT_ARGS=" |
| 199 | --log-interval 1 \ | 194 | --log-interval 1 \ |
| @@ -214,7 +209,6 @@ python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 214 | $MEM_ARGS \ | 209 | $MEM_ARGS \ |
| 215 | $MOE_ARGS \ | 210 | $MOE_ARGS \ |
| 216 | $DSA_ARGS \ | 211 | $DSA_ARGS \ |
| 217 | $CKPT_ARGS \ | ||
| 218 | ${OTHERS_ARGS[@]} \ | 212 | ${OTHERS_ARGS[@]} \ |
| 219 | --save $CKPT_SAVE_DIR \ | 213 | --save $CKPT_SAVE_DIR \ |
| 220 | --load $CKPT_LOAD_DIR \ | 214 | --load $CKPT_LOAD_DIR \ |
| @@ -1,6 +1,6 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | 2 | export HCCL_CONNECT_TIMEOUT=6000 |
| 3 | export HCCL_EXEC_TIMEOUT=3600 | 3 | export HCCL_EXEC_TIMEOUT=5400 |
| 4 | export HCCL_IF_BASE_PORT=48890 | 4 | export HCCL_IF_BASE_PORT=48890 |
| 5 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 5 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 6 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 6 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| @@ -138,15 +138,9 @@ GPT_ARGS=" | |||
| 138 | 138 | ||
| 139 | DATA_ARGS=" | 139 | DATA_ARGS=" |
| 140 | --data-path $DATA_PATH \ | 140 | --data-path $DATA_PATH \ |
| 141 | --handler-name GeneralPretrainHandler \ | ||
| 142 | --split 100,0,0 | 141 | --split 100,0,0 |
| 143 | " | 142 | " |
| 144 | 143 | ||
| 145 | CKPT_ARGS=" | ||
| 146 | --enable-hf2mg-convert \ | ||
| 147 | --model-type-hf longcat | ||
| 148 | " | ||
| 149 | |||
| 150 | OUTPUT_ARGS=" | 144 | OUTPUT_ARGS=" |
| 151 | --log-interval 1 \ | 145 | --log-interval 1 \ |
| 152 | --save-interval ${TRAIN_ITERS} \ | 146 | --save-interval ${TRAIN_ITERS} \ |
| @@ -162,7 +156,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 162 | $MOE_ARGS \ | 156 | $MOE_ARGS \ |
| 163 | $MLA_ARGS \ | 157 | $MLA_ARGS \ |
| 164 | $OUTPUT_ARGS \ | 158 | $OUTPUT_ARGS \ |
| 165 | $CKPT_ARGS \ | ||
| 166 | $OPTIMIZE_ARGS \ | 159 | $OPTIMIZE_ARGS \ |
| 167 | $TRAIN_ARGS \ | 160 | $TRAIN_ARGS \ |
| 168 | $MODEL_PARALLEL_ARGS \ | 161 | $MODEL_PARALLEL_ARGS \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | # distributed config | 4 | # distributed config |
| @@ -86,7 +84,6 @@ GPT_ARGS=" | |||
| 86 | 84 | ||
| 87 | DATA_ARGS=" | 85 | DATA_ARGS=" |
| 88 | --data-path $DATA_PATH \ | 86 | --data-path $DATA_PATH \ |
| 89 | --handler-name GeneralPretrainHandler \ | ||
| 90 | --split 100,0,0 | 87 | --split 100,0,0 |
| 91 | " | 88 | " |
| 92 | 89 | ||
| @@ -97,16 +94,10 @@ OUTPUT_ARGS=" | |||
| 97 | --eval-iters 0 \ | 94 | --eval-iters 0 \ |
| 98 | " | 95 | " |
| 99 | 96 | ||
| 100 | CKPT_ARGS=" | ||
| 101 | --enable-hf2mg-convert \ | ||
| 102 | --model-type-hf phi3.5 | ||
| 103 | " | ||
| 104 | |||
| 105 | torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | 97 | torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ |
| 106 | $GPT_ARGS \ | 98 | $GPT_ARGS \ |
| 107 | $DATA_ARGS \ | 99 | $DATA_ARGS \ |
| 108 | $OUTPUT_ARGS \ | 100 | $OUTPUT_ARGS \ |
| 109 | $CKPT_ARGS \ | ||
| 110 | --distributed-backend nccl \ | 101 | --distributed-backend nccl \ |
| 111 | --load ${CKPT_LOAD_DIR} \ | 102 | --load ${CKPT_LOAD_DIR} \ |
| 112 | --save ${CKPT_SAVE_DIR} \ | 103 | --save ${CKPT_SAVE_DIR} \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | # Change for multinode config | 4 | # Change for multinode config |
| @@ -125,7 +123,6 @@ TRAIN_ARGS=" | |||
| 125 | 123 | ||
| 126 | DATA_ARGS=" | 124 | DATA_ARGS=" |
| 127 | --data-path $DATA_PATH \ | 125 | --data-path $DATA_PATH \ |
| 128 | --handler-name GeneralPretrainHandler \ | ||
| 129 | --split 100,0,0 | 126 | --split 100,0,0 |
| 130 | " | 127 | " |
| 131 | 128 | ||
| @@ -137,11 +134,6 @@ OUTPUT_ARGS=" | |||
| 137 | --eval-iters 0 | 134 | --eval-iters 0 |
| 138 | " | 135 | " |
| 139 | 136 | ||
| 140 | CKPT_ARGS=" | ||
| 141 | --enable-hf2mg-convert \ | ||
| 142 | --model-type-hf phi3.5 | ||
| 143 | " | ||
| 144 | |||
| 145 | torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | 137 | torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ |
| 146 | $MOE_ARGS \ | 138 | $MOE_ARGS \ |
| 147 | $GPT_ARGS \ | 139 | $GPT_ARGS \ |
| @@ -149,7 +141,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 149 | $TRAIN_ARGS \ | 141 | $TRAIN_ARGS \ |
| 150 | $DATA_ARGS \ | 142 | $DATA_ARGS \ |
| 151 | $OUTPUT_ARGS \ | 143 | $OUTPUT_ARGS \ |
| 152 | $CKPT_ARGS \ | ||
| 153 | --distributed-backend nccl \ | 144 | --distributed-backend nccl \ |
| 154 | --load ${CKPT_LOAD_DIR} \ | 145 | --load ${CKPT_LOAD_DIR} \ |
| 155 | --save ${CKPT_SAVE_DIR} \ | 146 | --save ${CKPT_SAVE_DIR} \ |
| @@ -1,6 +1,5 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | 2 | export HCCL_CONNECT_TIMEOUT=1800 |
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 3 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | export NPU_ASD_ENABLE=0 | 4 | export NPU_ASD_ENABLE=0 |
| 6 | export HCCL_BUFFSIZE=64 | 5 | export HCCL_BUFFSIZE=64 |
| @@ -99,7 +98,6 @@ GPT_ARGS=" | |||
| 99 | 98 | ||
| 100 | DATA_ARGS=" | 99 | DATA_ARGS=" |
| 101 | --data-path $DATA_PATH \ | 100 | --data-path $DATA_PATH \ |
| 102 | --handler-name GeneralPretrainHandler \ | ||
| 103 | --split 100,0,0 | 101 | --split 100,0,0 |
| 104 | " | 102 | " |
| 105 | 103 | ||
| @@ -112,16 +110,10 @@ OUTPUT_ARGS=" | |||
| 112 | --no-save-rng | 110 | --no-save-rng |
| 113 | " | 111 | " |
| 114 | 112 | ||
| 115 | CKPT_ARGS=" | ||
| 116 | --enable-hf2mg-convert \ | ||
| 117 | --model-type-hf plm | ||
| 118 | " | ||
| 119 | |||
| 120 | python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ | 113 | python -m torch.distributed.launch $DISTRIBUTED_ARGS pretrain_gpt.py \ |
| 121 | $GPT_ARGS \ | 114 | $GPT_ARGS \ |
| 122 | $DATA_ARGS \ | 115 | $DATA_ARGS \ |
| 123 | $OUTPUT_ARGS \ | 116 | $OUTPUT_ARGS \ |
| 124 | $CKPT_ARGS \ | ||
| 125 | $MLA_ARGS \ | 117 | $MLA_ARGS \ |
| 126 | $ROPE_ARGS \ | 118 | $ROPE_ARGS \ |
| 127 | --distributed-backend nccl \ | 119 | --distributed-backend nccl \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 3 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| 6 | 4 | ||
| @@ -107,7 +105,6 @@ GPT_ARGS=" | |||
| 107 | 105 | ||
| 108 | DATA_ARGS=" | 106 | DATA_ARGS=" |
| 109 | --data-path $DATA_PATH \ | 107 | --data-path $DATA_PATH \ |
| 110 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 111 | --split 100,0,0 | 108 | --split 100,0,0 |
| 112 | " | 109 | " |
| 113 | 110 | ||
| @@ -120,16 +117,10 @@ OUTPUT_ARGS=" | |||
| 120 | --no-save-rng | 117 | --no-save-rng |
| 121 | " | 118 | " |
| 122 | 119 | ||
| 123 | CKPT_ARGS=" | ||
| 124 | --enable-hf2mg-convert \ | ||
| 125 | --model-type-hf plm | ||
| 126 | " | ||
| 127 | |||
| 128 | torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \ | 120 | torchrun $DISTRIBUTED_ARGS posttrain_gpt.py \ |
| 129 | $GPT_ARGS \ | 121 | $GPT_ARGS \ |
| 130 | $DATA_ARGS \ | 122 | $DATA_ARGS \ |
| 131 | $OUTPUT_ARGS \ | 123 | $OUTPUT_ARGS \ |
| 132 | $CKPT_ARGS \ | ||
| 133 | $MLA_ARGS \ | 124 | $MLA_ARGS \ |
| 134 | $ROPE_ARGS \ | 125 | $ROPE_ARGS \ |
| 135 | $FITUNE_ARGS \ | 126 | $FITUNE_ARGS \ |
| @@ -1,8 +1,7 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | 2 | ||
| 3 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 3 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 4 | export HCCL_CONNECT_TIMEOUT=3600 | 4 | export HCCL_CONNECT_TIMEOUT=1800 |
| 5 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 6 | 5 | ||
| 7 | NPUS_PER_NODE=8 | 6 | NPUS_PER_NODE=8 |
| 8 | MASTER_ADDR=localhost | 7 | MASTER_ADDR=localhost |
| @@ -97,15 +96,9 @@ GPT_ARGS=" | |||
| 97 | 96 | ||
| 98 | DATA_ARGS=" | 97 | DATA_ARGS=" |
| 99 | --data-path $DATA_PATH \ | 98 | --data-path $DATA_PATH \ |
| 100 | --handler-name GeneralPretrainHandler \ | ||
| 101 | --split 100,0,0 | 99 | --split 100,0,0 |
| 102 | " | 100 | " |
| 103 | 101 | ||
| 104 | CKPT_ARGS=" | ||
| 105 | --enable-hf2mg-convert \ | ||
| 106 | --model-type-hf llama2 | ||
| 107 | " | ||
| 108 | |||
| 109 | OUTPUT_ARGS=" | 102 | OUTPUT_ARGS=" |
| 110 | --log-interval 1 \ | 103 | --log-interval 1 \ |
| 111 | --save-interval 2000 \ | 104 | --save-interval 2000 \ |
| @@ -117,7 +110,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 117 | $GPT_ARGS \ | 110 | $GPT_ARGS \ |
| 118 | $DATA_ARGS \ | 111 | $DATA_ARGS \ |
| 119 | $OUTPUT_ARGS \ | 112 | $OUTPUT_ARGS \ |
| 120 | $CKPT_ARGS \ | ||
| 121 | --load ${CKPT_LOAD_DIR} \ | 113 | --load ${CKPT_LOAD_DIR} \ |
| 122 | --save ${CKPT_SAVE_DIR} \ | 114 | --save ${CKPT_SAVE_DIR} \ |
| 123 | --log-throughput \ | 115 | --log-throughput \ |
| @@ -1,7 +1,6 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 3 | export HCCL_CONNECT_TIMEOUT=3600 | 3 | export HCCL_CONNECT_TIMEOUT=1800 |
| 4 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 5 | 4 | ||
| 6 | NPUS_PER_NODE=8 | 5 | NPUS_PER_NODE=8 |
| 7 | MASTER_ADDR=localhost | 6 | MASTER_ADDR=localhost |
| @@ -99,15 +98,9 @@ GPT_ARGS=" | |||
| 99 | 98 | ||
| 100 | DATA_ARGS=" | 99 | DATA_ARGS=" |
| 101 | --data-path $DATA_PATH \ | 100 | --data-path $DATA_PATH \ |
| 102 | --handler-name GeneralPretrainHandler \ | ||
| 103 | --split 100,0,0 | 101 | --split 100,0,0 |
| 104 | " | 102 | " |
| 105 | 103 | ||
| 106 | CKPT_ARGS=" | ||
| 107 | --enable-hf2mg-convert \ | ||
| 108 | --model-type-hf llama2 | ||
| 109 | " | ||
| 110 | |||
| 111 | OUTPUT_ARGS=" | 104 | OUTPUT_ARGS=" |
| 112 | --log-interval 1 \ | 105 | --log-interval 1 \ |
| 113 | --save-interval 2000 \ | 106 | --save-interval 2000 \ |
| @@ -119,7 +112,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 119 | $GPT_ARGS \ | 112 | $GPT_ARGS \ |
| 120 | $DATA_ARGS \ | 113 | $DATA_ARGS \ |
| 121 | $OUTPUT_ARGS \ | 114 | $OUTPUT_ARGS \ |
| 122 | $CKPT_ARGS \ | ||
| 123 | --load ${CKPT_LOAD_DIR} \ | 115 | --load ${CKPT_LOAD_DIR} \ |
| 124 | --save ${CKPT_SAVE_DIR} \ | 116 | --save ${CKPT_SAVE_DIR} \ |
| 125 | --log-throughput \ | 117 | --log-throughput \ |
| @@ -1,7 +1,6 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 3 | export HCCL_CONNECT_TIMEOUT=3600 | 3 | export HCCL_CONNECT_TIMEOUT=1800 |
| 4 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 5 | 4 | ||
| 6 | NPUS_PER_NODE=16 | 5 | NPUS_PER_NODE=16 |
| 7 | MASTER_ADDR=localhost | 6 | MASTER_ADDR=localhost |
| @@ -95,15 +94,9 @@ GPT_ARGS=" | |||
| 95 | 94 | ||
| 96 | DATA_ARGS=" | 95 | DATA_ARGS=" |
| 97 | --data-path $DATA_PATH \ | 96 | --data-path $DATA_PATH \ |
| 98 | --handler-name GeneralPretrainHandler \ | ||
| 99 | --split 100,0,0 | 97 | --split 100,0,0 |
| 100 | " | 98 | " |
| 101 | 99 | ||
| 102 | CKPT_ARGS=" | ||
| 103 | --enable-hf2mg-convert \ | ||
| 104 | --model-type-hf llama2 | ||
| 105 | " | ||
| 106 | |||
| 107 | OUTPUT_ARGS=" | 100 | OUTPUT_ARGS=" |
| 108 | --log-interval 1 \ | 101 | --log-interval 1 \ |
| 109 | --save-interval 2000 \ | 102 | --save-interval 2000 \ |
| @@ -115,7 +108,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 115 | $GPT_ARGS \ | 108 | $GPT_ARGS \ |
| 116 | $DATA_ARGS \ | 109 | $DATA_ARGS \ |
| 117 | $OUTPUT_ARGS \ | 110 | $OUTPUT_ARGS \ |
| 118 | $CKPT_ARGS \ | ||
| 119 | --load ${CKPT_LOAD_DIR} \ | 111 | --load ${CKPT_LOAD_DIR} \ |
| 120 | --save ${CKPT_SAVE_DIR} \ | 112 | --save ${CKPT_SAVE_DIR} \ |
| 121 | --log-throughput \ | 113 | --log-throughput \ |
| @@ -1,7 +1,6 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 3 | export HCCL_CONNECT_TIMEOUT=3600 | 3 | export HCCL_CONNECT_TIMEOUT=1800 |
| 4 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 5 | 4 | ||
| 6 | NPUS_PER_NODE=8 | 5 | NPUS_PER_NODE=8 |
| 7 | MASTER_ADDR=localhost | 6 | MASTER_ADDR=localhost |
| @@ -95,15 +94,9 @@ GPT_ARGS=" | |||
| 95 | 94 | ||
| 96 | DATA_ARGS=" | 95 | DATA_ARGS=" |
| 97 | --data-path $DATA_PATH \ | 96 | --data-path $DATA_PATH \ |
| 98 | --handler-name GeneralPretrainHandler \ | ||
| 99 | --split 100,0,0 | 97 | --split 100,0,0 |
| 100 | " | 98 | " |
| 101 | 99 | ||
| 102 | CKPT_ARGS=" | ||
| 103 | --enable-hf2mg-convert \ | ||
| 104 | --model-type-hf llama2 | ||
| 105 | " | ||
| 106 | |||
| 107 | OUTPUT_ARGS=" | 100 | OUTPUT_ARGS=" |
| 108 | --log-interval 1 \ | 101 | --log-interval 1 \ |
| 109 | --save-interval 2000 \ | 102 | --save-interval 2000 \ |
| @@ -115,7 +108,6 @@ torchrun $DISTRIBUTED_ARGS pretrain_gpt.py \ | |||
| 115 | $GPT_ARGS \ | 108 | $GPT_ARGS \ |
| 116 | $DATA_ARGS \ | 109 | $DATA_ARGS \ |
| 117 | $OUTPUT_ARGS \ | 110 | $OUTPUT_ARGS \ |
| 118 | $CKPT_ARGS \ | ||
| 119 | --load ${CKPT_LOAD_DIR} \ | 111 | --load ${CKPT_LOAD_DIR} \ |
| 120 | --save ${CKPT_SAVE_DIR} \ | 112 | --save ${CKPT_SAVE_DIR} \ |
| 121 | --log-throughput \ | 113 | --log-throughput \ |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | NPUS_PER_NODE=8 | 4 | NPUS_PER_NODE=8 |
| @@ -106,7 +104,6 @@ GPT_ARGS=" | |||
| 106 | 104 | ||
| 107 | DATA_ARGS=" | 105 | DATA_ARGS=" |
| 108 | --data-path $DATA_PATH \ | 106 | --data-path $DATA_PATH \ |
| 109 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 110 | --split 100,0,0 | 107 | --split 100,0,0 |
| 111 | " | 108 | " |
| 112 | 109 | ||
| @@ -116,8 +113,6 @@ CKPT_ARGS=" | |||
| 116 | --no-save-optim \ | 113 | --no-save-optim \ |
| 117 | --no-save-rng \ | 114 | --no-save-rng \ |
| 118 | --seed 1234 \ | 115 | --seed 1234 \ |
| 119 | --enable-hf2mg-convert \ | ||
| 120 | --model-type-hf llama2 | ||
| 121 | " | 116 | " |
| 122 | 117 | ||
| 123 | OUTPUT_ARGS=" | 118 | OUTPUT_ARGS=" |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | NPUS_PER_NODE=16 | 4 | NPUS_PER_NODE=16 |
| @@ -106,7 +104,6 @@ GPT_ARGS=" | |||
| 106 | 104 | ||
| 107 | DATA_ARGS=" | 105 | DATA_ARGS=" |
| 108 | --data-path $DATA_PATH \ | 106 | --data-path $DATA_PATH \ |
| 109 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 110 | --split 100,0,0 | 107 | --split 100,0,0 |
| 111 | " | 108 | " |
| 112 | 109 | ||
| @@ -116,8 +113,6 @@ CKPT_ARGS=" | |||
| 116 | --no-save-optim \ | 113 | --no-save-optim \ |
| 117 | --no-save-rng \ | 114 | --no-save-rng \ |
| 118 | --seed 1234 \ | 115 | --seed 1234 \ |
| 119 | --enable-hf2mg-convert \ | ||
| 120 | --model-type-hf llama2 | ||
| 121 | " | 116 | " |
| 122 | 117 | ||
| 123 | OUTPUT_ARGS=" | 118 | OUTPUT_ARGS=" |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | 3 | ||
| 6 | NPUS_PER_NODE=8 | 4 | NPUS_PER_NODE=8 |
| @@ -99,7 +97,6 @@ GPT_ARGS=" | |||
| 99 | 97 | ||
| 100 | DATA_ARGS=" | 98 | DATA_ARGS=" |
| 101 | --data-path $DATA_PATH \ | 99 | --data-path $DATA_PATH \ |
| 102 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 103 | --split 100,0,0 | 100 | --split 100,0,0 |
| 104 | " | 101 | " |
| 105 | 102 | ||
| @@ -109,8 +106,6 @@ CKPT_ARGS=" | |||
| 109 | --no-save-optim \ | 106 | --no-save-optim \ |
| 110 | --no-save-rng \ | 107 | --no-save-rng \ |
| 111 | --seed 1234 \ | 108 | --seed 1234 \ |
| 112 | --enable-hf2mg-convert \ | ||
| 113 | --model-type-hf llama2 | ||
| 114 | " | 109 | " |
| 115 | 110 | ||
| 116 | OUTPUT_ARGS=" | 111 | OUTPUT_ARGS=" |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 3 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| 6 | 4 | ||
| @@ -107,7 +105,6 @@ GPT_ARGS=" | |||
| 107 | 105 | ||
| 108 | DATA_ARGS=" | 106 | DATA_ARGS=" |
| 109 | --data-path $DATA_PATH \ | 107 | --data-path $DATA_PATH \ |
| 110 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 111 | --split 100,0,0 | 108 | --split 100,0,0 |
| 112 | " | 109 | " |
| 113 | 110 | ||
| @@ -117,8 +114,6 @@ CKPT_ARGS=" | |||
| 117 | --no-save-optim \ | 114 | --no-save-optim \ |
| 118 | --no-save-rng \ | 115 | --no-save-rng \ |
| 119 | --seed 1234 \ | 116 | --seed 1234 \ |
| 120 | --enable-hf2mg-convert \ | ||
| 121 | --model-type-hf llama2 | ||
| 122 | " | 117 | " |
| 123 | 118 | ||
| 124 | OUTPUT_ARGS=" | 119 | OUTPUT_ARGS=" |
| @@ -1,6 +1,4 @@ | |||
| 1 | #!/bin/bash | 1 | #!/bin/bash |
| 2 | export HCCL_CONNECT_TIMEOUT=3600 | ||
| 3 | export HCCL_EXEC_TIMEOUT=3600 | ||
| 4 | export CUDA_DEVICE_MAX_CONNECTIONS=1 | 2 | export CUDA_DEVICE_MAX_CONNECTIONS=1 |
| 5 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True | 3 | export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True |
| 6 | 4 | ||
| @@ -104,7 +102,6 @@ GPT_ARGS=" | |||
| 104 | 102 | ||
| 105 | DATA_ARGS=" | 103 | DATA_ARGS=" |
| 106 | --data-path $DATA_PATH \ | 104 | --data-path $DATA_PATH \ |
| 107 | --handler-name AlpacaStyleInstructionHandler \ | ||
| 108 | --split 100,0,0 | 105 | --split 100,0,0 |
| 109 | " | 106 | " |
| 110 | 107 | ||
| @@ -114,8 +111,6 @@ CKPT_ARGS=" | |||
| 114 | --no-save-optim \ | 111 | --no-save-optim \ |
| 115 | --no-save-rng \ | 112 | --no-save-rng \ |
| 116 | --seed 1234 \ | 113 | --seed 1234 \ |
| 117 | --enable-hf2mg-convert \ | ||
| 118 | --model-type-hf llama2 | ||
| 119 | " | 114 | " |
| 120 | 115 | ||
| 121 | OUTPUT_ARGS=" | 116 | OUTPUT_ARGS=" |