Sparse-dLLM:基于动态缓存与稀疏注意力的扩散大语言模型加速框架

可用于加速扩散大语言模型(dLLMs)解码,提升长上下文推理效率。该框架通过动态缓存驱逐与稀疏注意力结合,在不重新训练的情况下减少冗余缓存状态,保持相近峰值内存占用,实现更高吞吐量。【此简介由AI生成】

分支1Tags0

项目介绍

可用于加速扩散大语言模型(dLLMs)解码,提升长上下文推理效率。该框架通过动态缓存驱逐与稀疏注意力结合,在不重新训练的情况下减少冗余缓存状态,保持相近峰值内存占用,实现更高吞吐量。【此简介由AI生成】

定制我的领域