apiversion: multimodal_vlm_modelslim_v1
metadata:
config_id: gemma4_w8a8
score: 90
verified_tags:
gemma-4-31B-it:
- - vLLM_Ascend
- Atlas_A2_Inference
- - vLLM_Ascend
- Atlas_A3_Inference
- - vLLM_Ascend
- Ascend_950
label:
w_bit: 8
a_bit: 8
is_sparse: False
kv_cache: False
default_w8a8_dynamic: &default_w8a8_dynamic
act:
scope: "per_token"
dtype: "int8"
symmetric: True
method: "minmax"
weight:
scope: "per_channel"
dtype: "int8"
symmetric: True
method: "minmax"
spec:
process:
- type: "linear_quant"
qconfig: *default_w8a8_dynamic
include:
- "*"
exclude:
- "*vision_tower*"
- "*embed_vision*"
- "model.language_model.layers.2.mlp.down_proj"
- "model.language_model.layers.14.mlp.down_proj"
- "model.language_model.layers.45.mlp.down_proj"
- "model.language_model.layers.47.mlp.down_proj"
- "model.language_model.layers.46.mlp.down_proj"
save:
- type: "ascendv1_saver"
part_file_size: 4
dataset: "calibImages"
default_text: "Describe this image in detail."