ChatGLM2-6B-TensorRT:ChatGLM2-6B模型的TensorRT加速部署方案

提供ChatGLM2-6B模型从PyTorch到ONNX再到TensorRT的完整转换流程,显著提升推理速度,3090平台提速34.4%-55.5%,支持FP16/FP32格式,需16G+显存。【此简介由AI生成】

分支1Tags1

项目介绍

提供ChatGLM2-6B模型从PyTorch到ONNX再到TensorRT的完整转换流程,显著提升推理速度,3090平台提速34.4%-55.5%,支持FP16/FP32格式,需16G+显存。【此简介由AI生成】

定制我的领域