可快速提升 LLM 在 NVIDIA 平台的推理性能,如 LLaMA 2 可达 1200 tokens/秒(比框架快 28 倍)。通过修改一行现有 transformers 代码即可集成,支持 FP8 量化等高级特性,适配多种 NVIDIA GPU 架构。【此简介由AI生成】
可快速提升 LLM 在 NVIDIA 平台的推理性能,如 LLaMA 2 可达 1200 tokens/秒(比框架快 28 倍)。通过修改一行现有 transformers 代码即可集成,支持 FP8 量化等高级特性,适配多种 NVIDIA GPU 架构。【此简介由AI生成】