可用于昇腾NPU上的模型量化压缩,减小模型体积并提升推理性能。支持INT8/INT4/MXFP8/HiFloat8等多精度格式,提供PTQ量化算法及大模型量化方案,硬件亲和且部署便捷。【此简介由AI生成】