FlexGen:Running large language models on a single GPU for throughput-oriented scenarios.

Running large language models on a single GPU for throughput-oriented scenarios.

分支2Tags0

项目介绍

在面向吞吐量的场景下,利用单个GPU运行大型语言模型。【此简介由AI生成】

定制我的领域
59.36 K592访问 GitHub