已合并
[pytorch][bugfix]fix script of glm45-moe #4131
温一盏创建于 1月30日
[pytorch][bugfix]fix script of glm45-moe #4131
已合并
温一盏创建于 1月30日
3 个文件变更+0-3
Mexamples/mcore/glm45-moe/ckpt_convert_glm45_moe_hf2mcore.sh+0-1
@@ -5,7 +5,6 @@ export CUDA_DEVICE_MAX_CONNECTIONS=1
5# 权重格式转换5# 权重格式转换
6python convert_ckpt_v2.py \6python convert_ckpt_v2.py \
7 --model-type-hf glm45-moe \7 --model-type-hf glm45-moe \
8- --post-norm \
9 --load-model-type hf \8 --load-model-type hf \
10 --save-model-type mg \9 --save-model-type mg \
11 --target-tensor-parallel-size 8 \10 --target-tensor-parallel-size 8 \
Mexamples/mcore/glm45-moe/generate_glm45_moe_106b_ptd.sh+0-1
@@ -61,7 +61,6 @@ GPT_ARGS="
61 --disable-bias-linear \61 --disable-bias-linear \
62 --add-qkv-bias \62 --add-qkv-bias \
63 --swiglu \63 --swiglu \
64- --post-norm \
65 --norm-epsilon 1e-05 \64 --norm-epsilon 1e-05 \
66 --hidden-dropout 0.0 \65 --hidden-dropout 0.0 \
67 --attention-dropout 0.0 \66 --attention-dropout 0.0 \
Mexamples/mcore/glm45-moe/pretrain_glm45_moe_106b_4k_A3_ptd.sh+0-1
@@ -57,7 +57,6 @@ GPT_ARGS="
57 --use-mcore-models \57 --use-mcore-models \
58 --use-flash-attn \58 --use-flash-attn \
59 --mtp-num-layers 1 \59 --mtp-num-layers 1 \
60- --post-norm \
61 --kv-channels 128 \60 --kv-channels 128 \
62 --use-fused-rmsnorm \61 --use-fused-rmsnorm \
63 --use-fused-swiglu \62 --use-fused-swiglu \