已合并
在P节点tokenizer后,校验请求长度+最大输出长度 > 模型上下文长度, 避免P产生KV cache残留问题 #513
在P节点tokenizer后,校验请求长度+最大输出长度 > 模型上下文长度, 避免P产生KV cache残留问题 #513
已合并
tobking创建于 21 天前
tobking
tobking成员
21 天前

1. 合入背景

请描述为什么要做这个PR内的改动。
如涉及,请关联前序PR或同特性/需求下的其他PR。
如果是修复之前PR引入的问题,请关联引入问题的PR。
请通过#ISSUE ID关联issue。
注意:Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代.
#309

2. 修改内容

描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列。
如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容)。
Coordinator 在构造 _motor_dispatch 时,从原始 req_info.req_data 提取输出预算:
优先使用 max_completion_tokens;
否则使用 max_tokens。
为 MotorDispatch 增加可选字段 original_max_output_tokens,并随 dispatch 传递至 P 实例。
P 侧 vLLM adapter 从 MotorDispatch 读取该字段。
在 prompt render/tokenizer 完成后,校验:

3. 资料变更

请确认是否涉及资料变更
如涉及,需要在PR中体现,并简要说明修改内容。
如不涉及,需填写“不涉及”。
不涉及

4. 接口变更

请确认是否涉及跨代码仓或者客户面可见的接口变更
如涉及,需详细说明接口以及对应的变更内容,同时需要在资料中体现。
如不涉及,需填写“不涉及”。
不涉及

5. 测试结果

需体现测试场景,测试方法以及测试结果
测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。

6. CheckList

PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]

[ ] 代码注释完备

[ ] 正确记录维测日志

[ ] 是否有UT用例

[ ] 若涉及多线程场景,考虑了并发场景,不存在死锁问题

likedislike
Pull Request已成功合入, 合并人@wangyang
(感谢 tobking 的贡献)
atomgit-bot
atomgit-bot
21 天前 评论:
likedislike
不准确?
此处折叠了93条消息 查看更多
ascend-robotascend-robot成员
21 天前 删除了label:ci-pipeline-running
ascend-robotascend-robot成员
21 天前 添加了label:ci-pipeline-passed
ascend-robot
ascend-robot成员
21 天前 评论:
likedislike
wangyangwangyang成员
21 天前 关闭了关联的issue
wangyangwangyang成员
21 天前 合入了pull request