turboquant_plus:基于 KV 缓存压缩技术的本地 LLM 推理优化项目

用户可利用该项目实现本地大语言模型推理时的 KV 缓存压缩与加速,通过 PolarQuant + Walsh-Hadamard 旋转实现 4.6–6.4 倍压缩,结合注意力门控解码提升长上下文解码速度,支持多种压缩格式且保证低 perplexity 增长。【此简介由AI生成】

Branch13Tags3

Introduction

用户可利用该项目实现本地大语言模型推理时的 KV 缓存压缩与加速,通过 PolarQuant + Walsh-Hadamard 旋转实现 4.6–6.4 倍压缩,结合注意力门控解码提升长上下文解码速度,支持多种压缩格式且保证低 perplexity 增长。【此简介由AI生成】

Customize your domain
646.99 K922Visit GitHub