已合并
异步不分层-dev分支 #705
异步不分层-dev分支 #705
已合并
Snoopy99创建于 3月28日
Snoopy99
Snoopy99
3月28日

合入背景

请描述为什么要做这个PR内的改动。
如涉及,请关联前序PR或同特性/需求下的其他PR。
如果是修复之前PR引入的问题,请关联引入问题的PR。
注意:Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代.

Fix #59

修改内容

  1. 加入event机制,通过wait和record两种event来同步save流和forward流,从而实现在计算的同时异步save kv cache。
  2. 调整组图,新增mempool图(仅用于prefill),用于处理没有历史kv cache、并需要异步save的情况。同时,将现有的splitfuse图调整为支持异步save。
  3. 该特性目前主要适配了DeepSeek和Qwen稠密模型,支持异步调度、Prefix Cache、Context Parallel、Sequence Parallel、MTP、Function Call、思考解析等特性,暂不支持SplitFuse、Micro Batch、Multi-Lora特性。

资料变更

请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及”。

修改了docs/zh/user_guide/feature/kv_cache_pooling.md和mindie_llm/text_generator/mempool/README.md,说明了如何通过修改config.json开启“异步写”特性(默认不开启),以及(不)支持叠加的模型、特性列表。

接口变更

请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及”。

见资料变更。

测试结果

请说明测试场景,测试方法以及测试结果。
测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。

模型 测试类目 数据集 配置 结果 备注
DeepSeek V3.1 精度 GPQA 64并发 + CP/SP + 异步推理 + 同步写 Acc 68.18% 基线(pr合入前)
DeepSeek V3.1 精度 GPQA 64并发 + CP/SP + 异步推理 + 异步写 Acc 71.21% 精度相比同步写无下降
DeepSeek V3.1 性能 GSM8K 1并发 + CP/SP + 异步推理+ 8k输入 TTFT 1536.9 ms 不开Prefix Cache特性
DeepSeek V3.1 性能 GSM8K 1并发 + CP/SP + 异步推理 + 同步写+ 8k输入 TTFT 1135.4 ms 基线(pr合入前)
DeepSeek V3.1 性能 GSM8K 1并发 + CP/SP + 异步推理 + 异步写+ 8k输入 TTFT 1087.8 ms 相比不开PC,在50%命中情况下性能提升29.2%;相比同步写提升4.2%
DeepSeek V3.1 性能 GSM8K 64并发 + DP/TP + 异步推理 + 同步写 + 8k输入 TTFT 2228.9 ms 基线(pr合入前)
DeepSeek V3.1 性能 GSM8K 64并发 + DP/TP + 异步推理 + 异步写 + 8k输入 TTFT 2036.0 ms 性能相比同步写提升8.65%
DeepSeek V3.1 性能 GSM8K 2P1D + 32并发 + DP/TP + 异步推理 + 同步写+ 16k输入 TTFT 6109.5 ms 基线(pr合入前)
DeepSeek V3.1 性能 GSM8K 2P1D + 32并发 + DP/TP + 异步推理 + 异步写+ 16k输入 TTFT 5880.6 ms 性能相比同步写提升3.75%
模型 测试类目 数据集 配置 结果 备注
Qwen3-32B 精度 GPQA 64并发 + 异步推理 + 异步写 Acc 62.12%
Qwen3-32B 性能 GSM8K 1并发 + 异步推理+ 8k输入 TTFT 1575.3 ms 不开PC
Qwen3-32B 性能 GSM8K 1并发 + 异步推理 + 同步写+ 8k输入 TTFT 1159.8 ms 基线(pr合入前)
Qwen3-32B 性能 GSM8K 1并发 + 异步推理 + 异步写+ 8k输入 TTFT 1098.3 ms 相比不开PC,在50%命中情况下性能提升30.3%;相比同步写提升5.3%
Qwen3-32B 性能 GSM8K 64并发 + 异步推理 + 同步写 + 16k输入 TTFT 6786.4 ms 基线(pr合入前)
Qwen3-32B 性能 GSM8K 64并发 + 异步推理 + 异步写 + 16k输入 TTFT 5969.9 ms 性能相比同步写提升12.03%

CheckList

PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]。

likedislike
Pull Request已成功合入, 合并人@ascend-robot
(感谢 Snoopy99 的贡献)
Snoopy99Snoopy99
3月28日 关联了issue:[新需求]: KV Cache池化异步写
ascend-robotascend-robot成员
3月28日 添加了label:stat/needs-squash
ascend-robotascend-robot成员
3月28日 添加了label:ascend-cla/yes
ascend-robot
ascend-robot成员
3月28日 评论:

Thanks for your pull-request.
The full list of commands accepted by me can be found at here
You can get sig-info at here


PR Approval Progress

Congratulations! All modules have met the lgtm and approve requirements.

Module Approval Details

module lgtm status approve status
repo-Ascend/MindIE-LLM taojiovvo, hw-zhoutianyang (2/2) taojiovvo (1/1)

💡 Tip:

  • Committer can comment /approve or /lgtm
  • Commenting /approve implies both code review (lgtm) and intent to merge (approve)

CLA Signature Pass

qq_43507202, thanks for your pull request. All authors of the commits have signed the CLA. 👍

likedislike
Snoopy99Snoopy99
3月28日 修改了pull request 的描述
此处折叠了85条消息 查看更多
ascend-robotascend-robot成员
4月1日 添加了label:lgtm
纪涛
纪涛成员
4月1日 评论:

/merge

likedislike
ascend-robotascend-robot成员
4月1日 添加了label:keeper_approved
ascend-robot
ascend-robot成员
4月1日 评论:

Review Guide

This pull-request passes review.
Committers who wrote a comment of /approve are: taojiovvo.
Reviewers who wrote a comment of /lgtm are: taojiovvo, hw-zhoutianyang.

likedislike
ascend-robotascend-robot成员
4月1日 合入了pull request