已合并
[pytorch][bugfix]fix script of glm45-moe #4131
温一盏创建于 1月30日
[pytorch][bugfix]fix script of glm45-moe #4131
已合并
共 3 个文件变更+0-3
| @@ -5,7 +5,6 @@ export CUDA_DEVICE_MAX_CONNECTIONS=1 | |||
| 5 | # 权重格式转换 | 5 | # 权重格式转换 |
| 6 | python convert_ckpt_v2.py \ | 6 | python convert_ckpt_v2.py \ |
| 7 | --model-type-hf glm45-moe \ | 7 | --model-type-hf glm45-moe \ |
| 8 | - --post-norm \ | ||
| 9 | --load-model-type hf \ | 8 | --load-model-type hf \ |
| 10 | --save-model-type mg \ | 9 | --save-model-type mg \ |
| 11 | --target-tensor-parallel-size 8 \ | 10 | --target-tensor-parallel-size 8 \ |
| @@ -61,7 +61,6 @@ GPT_ARGS=" | |||
| 61 | --disable-bias-linear \ | 61 | --disable-bias-linear \ |
| 62 | --add-qkv-bias \ | 62 | --add-qkv-bias \ |
| 63 | --swiglu \ | 63 | --swiglu \ |
| 64 | - --post-norm \ | ||
| 65 | --norm-epsilon 1e-05 \ | 64 | --norm-epsilon 1e-05 \ |
| 66 | --hidden-dropout 0.0 \ | 65 | --hidden-dropout 0.0 \ |
| 67 | --attention-dropout 0.0 \ | 66 | --attention-dropout 0.0 \ |
| @@ -57,7 +57,6 @@ GPT_ARGS=" | |||
| 57 | --use-mcore-models \ | 57 | --use-mcore-models \ |
| 58 | --use-flash-attn \ | 58 | --use-flash-attn \ |
| 59 | --mtp-num-layers 1 \ | 59 | --mtp-num-layers 1 \ |
| 60 | - --post-norm \ | ||
| 61 | --kv-channels 128 \ | 60 | --kv-channels 128 \ |
| 62 | --use-fused-rmsnorm \ | 61 | --use-fused-rmsnorm \ |
| 63 | --use-fused-swiglu \ | 62 | --use-fused-swiglu \ |