deepseek-v3.2-w4a8:基于昇腾NPU的量化权重推理项目

可用于在昇腾NPU上实现高效的大模型推理,提供DeepSeek-V3.2(671B MoE)的W4A8量化权重,基于msModelSlim生成,适配vLLM-Ascend推理引擎,支持投机解码,在GSM8K等数据集上零精度损失。【此简介由AI生成】

分支1Tags0
文件最后提交记录最后更新时间
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前
1 个月前

DeepSeek-V3.2 W4A8 (Ascend)

DeepSeek-V3.2(671B MoE)的 W4A8 量化权重,基于 msModelSlim 生成,面向昇腾 NPU + vLLM-Ascend 推理。

量化策略

部分 精度
路由专家 (MoE experts) W4A8(int4 权重 + int8 激活,per-channel dynamic,SSZ)
注意力 / dense / 共享专家 / MTP 层 W8A8(int8)
embedding / norm / gate / lm_head FLOAT(回退不量化)
  • 前处理:QuaRot 旋转 + FlexAWQSSZ + FlexSmoothQuant
  • MTP 层(layer 61)保留 W8A8,保证投机解码 draft 接受率
  • 校准集:CoT 推理文本(qwen3_cot_w4a4.json,模型无关)
  • 产物:89 分片 / 350 GB

精度验证结果

推理引擎 vLLM-Ascend v0.23.0rc1,TP8,--quantization ascend,投机解码 deepseek_mtp;评测工具 AISBench。

数据集 模式 测试精度 官方参考 说明
GSM8K 0-shot CoT 92.04% ≈92.3 持平
GPQA Diamond 非思考态 75.76% 198/198 答案格式命中
GPQA Diamond 思考态 82.32% ~80 超官方参考

结论:W4A8 量化在 GSM8K / GPQA 上相对 BF16/FP8 基线零精度损失,GPQA 思考态甚至略高于官方参考值(噪声范围内)。

注:GPQA 思考态经 <think> 触发;198 题输出格式全部命中、无截断,口径干净。

服务化启动(vLLM-Ascend)

export VLLM_USE_V1=1
export VLLM_ASCEND_ENABLE_MLAPO=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=200

vllm serve <本仓库路径> \
  --host 0.0.0.0 --port 8000 \
  --data-parallel-size 1 --tensor-parallel-size 8 \
  --quantization ascend --served-model-name deepseek_v3_2 \
  --enable-expert-parallel --max-num-seqs 8 \
  --max-model-len 32768 --max-num-batched-tokens 4096 \
  --trust-remote-code --no-enable-prefix-caching --gpu-memory-utilization 0.92 \
  --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
  --speculative-config '{"num_speculative_tokens":3,"method":"deepseek_mtp"}'
  • 8×910B4(512G HBM)单机可部署;KV cache 实测上限约 77K tokens(模型原生支持 160K,受单机显存限制)。

项目介绍

可用于在昇腾NPU上实现高效的大模型推理,提供DeepSeek-V3.2(671B MoE)的W4A8量化权重,基于msModelSlim生成,适配vLLM-Ascend推理引擎,支持投机解码,在GSM8K等数据集上零精度损失。【此简介由AI生成】

定制我的领域