用户可利用该项目实现本地大语言模型推理时的 KV 缓存压缩与加速,通过 PolarQuant + Walsh-Hadamard 旋转实现 4.6–6.4 倍压缩,结合注意力门控解码提升长上下文解码速度,支持多种压缩格式且保证低 perplexity 增长。【此简介由AI生成】
Introduction
用户可利用该项目实现本地大语言模型推理时的 KV 缓存压缩与加速,通过 PolarQuant + Walsh-Hadamard 旋转实现 4.6–6.4 倍压缩,结合注意力门控解码提升长上下文解码速度,支持多种压缩格式且保证低 perplexity 增长。【此简介由AI生成】
Customize your domain