optimum-nvidia:基于 Hugging Face 的 NVIDIA 平台 LLM 推理加速项目

可快速提升 LLM 在 NVIDIA 平台的推理性能,如 LLaMA 2 可达 1200 tokens/秒(比框架快 28 倍)。通过修改一行现有 transformers 代码即可集成,支持 FP8 量化等高级特性,适配多种 NVIDIA GPU 架构。【此简介由AI生成】

分支14Tags8

项目介绍

可快速提升 LLM 在 NVIDIA 平台的推理性能,如 LLaMA 2 可达 1200 tokens/秒(比框架快 28 倍)。通过修改一行现有 transformers 代码即可集成,支持 FP8 量化等高级特性,适配多种 NVIDIA GPU 架构。【此简介由AI生成】

定制我的领域
341.04 K103访问 GitHub