可用于加速扩散大语言模型(dLLMs)解码,提升长上下文推理效率。该框架通过动态缓存驱逐与稀疏注意力结合,在不重新训练的情况下减少冗余缓存状态,保持相近峰值内存占用,实现更高吞吐量。【此简介由AI生成】