Qwen-TensorRT-LLM:基于TensorRT-LLM实现Qwen系列模型推理加速,支持多量化方案与多部署方式

利用TensorRT-LLM对Qwen/Qwen2系列模型进行推理加速,支持多种量化方案及多卡并行,提供Web Demo、Triton部署、OpenAI兼容API等多种使用方式,适配多种模型规格。【此简介由AI生成】

分支4Tags4

项目介绍

利用TensorRT-LLM对Qwen/Qwen2系列模型进行推理加速,支持多种量化方案及多卡并行,提供Web Demo、Triton部署、OpenAI兼容API等多种使用方式,适配多种模型规格。【此简介由AI生成】

定制我的领域