Wan 2.1 T2V 1.3B 在昇腾上部署 MXFP4 W4A4 时,若直接对稠密权重做推理量化,FFN 误差会反映到生成质量。需要在训练阶段用与推理算子一致的伪量化,让 Student 学会补偿这部分误差。
在 FlashGen 中支持 Wan 2.1 T2V 1.3B 的 MXFP4 W4A4 QAT:
aclnnDynamicDualLevelMxQuant
ffn.fc_in
ffn.fc_out
FineTuneMethod
pyarrow==19.0.1
包含:
flashgen/methods/mxfp4_fakequant.py
flashgen/networks/wan.py
flashgen/configs/wan_qat.yaml
tests/test_mxfp4_fakequant.py
不包含:
wan_qat.yaml
MXFP4 fake-quant enabled
mxfp4_quant
背景
Wan 2.1 T2V 1.3B 在昇腾上部署 MXFP4 W4A4 时,若直接对稠密权重做推理量化,FFN 误差会反映到生成质量。需要在训练阶段用与推理算子一致的伪量化,让 Student 学会补偿这部分误差。
目标
在 FlashGen 中支持 Wan 2.1 T2V 1.3B 的 MXFP4 W4A4 QAT:
aclnnDynamicDualLevelMxQuant对齐(宏组 512 / block 32,E2M1,饱和 6.0)ffn.fc_in/ffn.fc_outFineTuneMethod,FlashGen 只补充伪量化与注入pyarrow==19.0.1)范围
包含:
flashgen/methods/mxfp4_fakequant.pyflashgen/networks/wan.py注入逻辑flashgen/configs/wan_qat.yamltests/test_mxfp4_fakequant.py不包含:
验收
wan_qat.yaml可拉起训练,日志出现MXFP4 fake-quant enabledmxfp4_quant块可回退稠密微调