提供ChatGLM2-6B模型从PyTorch到ONNX再到TensorRT的完整转换流程,显著提升推理速度,3090平台提速34.4%-55.5%,支持FP16/FP32格式,需16G+显存。【此简介由AI生成】