可用于长上下文任务处理,该项目核心是Kimi Delta Attention机制,采用混合架构提升性能与硬件效率,减少KV缓存需求达75%,解码吞吐量提升最高6倍,支持1M tokens上下文长度。【此简介由AI生成】