| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
[bugfix] draft model weight filter Co-authored-by: ganglv<lvgang1@huawei.com> # message auto-generated for no-merge-commit merge: !618 merge draft_model_weight_bugfix into master [bugfix] draft model weight filter Created-by: ganglv Commit-by: ganglv Merged-by: tobking Description: ## **1. 合入背景** > 请描述为什么要做这个PR内的改动。\ > 如涉及,请关联前序PR或同特性/需求下的其他PR。\ > 如果是修复之前PR引入的问题,请关联引入问题的PR。\ > 请通过#ISSUE ID关联issue。\ > 注意: Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代. [#371](https://gitcode.com/Ascend/MindIE-Motor/issues/371) ## **2. 修改内容** > 请<ins>**描述修改内容的具体实现**</ins>,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列。 > 如果是需求或者重构类的PR,需要<ins>**补充详细设计文档**</ins>(说明上下游组件关系、时序图、类图、DFX能力等内容)。 将过滤函数由自定义的_is_mtp_weight改为vllm提供的get_spec_layer_idx_from_weight_name ## **3. 资料变更** > 请确认<ins>**是否涉及资料变更**</ins>。\ > 如涉及,需要在PR中体现,并简要说明修改内容。\ > 如不涉及,需填写“不涉及”。 不涉及 ## **4. 接口变更** > 请确认<ins>**是否涉及跨代码仓或者客户面可见的接口变更**</ins>。\ > 如涉及,需详细说明接口以及对应的变更内容,同时需要在资料中体现。\ > 如不涉及,需填写“不涉及”。 不涉及 ## **5. 测试结果** > 需体现<ins>**测试场景,测试方法以及测试结果**</ins>。\ > 测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。  ## **6. CheckList** > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] [x] 代码注释完备 [x] 正确记录维测日志 [ ] 是否有UT用例 [ ] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 See merge request: Ascend/MindIE-Motor!618 | 25 天前 | |
[fix] 修复加载草稿模型慢的问题 Co-authored-by: c00951058<chenchaofeng5@huawei.com> # message auto-generated for no-merge-commit merge: !423 merge c00951058 into master [fix] 修复加载草稿模型慢的问题 Created-by: qq_40172610 Commit-by: c00951058 Merged-by: towncharlie Description: ## **1. 合入背景** 在 PD 分离 + 推测解码(MTP / deepseek_mtp)场景下,加载草稿模型(drafter)时,vLLM 的 DefaultModelLoader 会重新遍历权重目录下的全部 safetensors 文件,包含主模型的全部张量(DeepSeek V3.1 量化后权重约700 GB),仅为了从中挑出少量属于 MTP 层的张量。这导致: 草稿模型加载阶段产生大量无谓的磁盘 I/O,读取了本不需要的主模型权重; 端到端拉起时间显著变长,尤其在 NFS/Lustre 等网络文件系统上更为明显。 本 PR 仅涉及 examples/deployer/patch/0.23.0/ 下针对 vLLM 0.23.0 的补丁,目标是缩短草稿模型(MTP)权重加载时间,从而降低实例端到端拉起时长。 fixes [#239](https://gitcode.com/Ascend/MindIE-PyMotor/issues/239) ## **2. 修改内容** 本 PR 通过在 safetensors 权重迭代器中引入「按权重名过滤、在读盘前跳过」的能力,使草稿模型加载时只读取 MTP 相关张量。涉及以下补丁文件及组件交互: - vllm_mtp_deepseek_mtp.patch - vllm_shuffle_default_loader.patch - vllm_shuffle_weight_utils.patch - vllm_shuffle_load_config.patch - patch_apply_shuffle_safetensors.py 调用链路:DeepSeekMTP.weight_name_filter → DefaultModelLoader.Source.weight_filter → safetensors_weights_iterator(weight_filter=...) → 读盘前跳过非 MTP 权重。 ## **3. 资料变更** 不涉及。 ## **4. 接口变更** 不涉及。 ## **5. 测试结果** p端到端时长约8分钟  d端到端时长约7分钟   p中草稿模型拉起时间约30秒:  d中草稿模型拉起时间约20秒:  ## **6. CheckList** > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] [x] 代码注释完备 [x] 正确记录维测日志 [x] 是否有UT用例 [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 See merge request: Ascend/MindIE-PyMotor!423 | 1 个月前 | |
[fix] 补丁增加对 vllm 0.23.0 的支持 Co-authored-by: c00951058<chenchaofeng5@huawei.com> # message auto-generated for no-merge-commit merge: !364 merge c00951058 into master [fix] 补丁增加对 vllm 0.23.0 的支持 Created-by: qq_40172610 Commit-by: c00951058 Merged-by: towncharlie Description: ## **1. 合入背景** Motor 在 vLLM 0.23.0 环境下启动 engine_server 时,会因 vLLM 重构 entrypoints 模块路径而报 ModuleNotFoundError,导致推理服务无法正常拉起。本次合入用于补齐对 vLLM 0.23.0 的兼容支持,修复相关导入错误。 ## **2. 修改内容** 在 vllm_openai_compat.py 中集中增加 RequestLogger、process_lora_modules、cli_env_setup 的兼容导入:优先使用 vLLM 0.23.0 新路径,导入失败时回退到旧路径。 同时调整 vllm_endpoint.py、vllm_engine.py、serving_chat.py、serving_completion.py,将上述符号的导入统一改为从 vllm_openai_compat 获取,避免业务代码直接依赖已变更的 vLLM 模块路径。共修改 5 个文件。 ## **3. 资料变更** 不涉及 ## **4. 接口变更** 不涉及 ## **5. 测试结果** p节点,拉起时间约8分钟  d节点,拉起时间约8分钟   ## **6. CheckList** > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] [x] 代码注释完备 [x] 正确记录维测日志 [x] 是否有UT用例 [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 See merge request: Ascend/MindIE-PyMotor!364 | 1 个月前 | |
[fix] 修复加载草稿模型慢的问题 Co-authored-by: c00951058<chenchaofeng5@huawei.com> # message auto-generated for no-merge-commit merge: !423 merge c00951058 into master [fix] 修复加载草稿模型慢的问题 Created-by: qq_40172610 Commit-by: c00951058 Merged-by: towncharlie Description: ## **1. 合入背景** 在 PD 分离 + 推测解码(MTP / deepseek_mtp)场景下,加载草稿模型(drafter)时,vLLM 的 DefaultModelLoader 会重新遍历权重目录下的全部 safetensors 文件,包含主模型的全部张量(DeepSeek V3.1 量化后权重约700 GB),仅为了从中挑出少量属于 MTP 层的张量。这导致: 草稿模型加载阶段产生大量无谓的磁盘 I/O,读取了本不需要的主模型权重; 端到端拉起时间显著变长,尤其在 NFS/Lustre 等网络文件系统上更为明显。 本 PR 仅涉及 examples/deployer/patch/0.23.0/ 下针对 vLLM 0.23.0 的补丁,目标是缩短草稿模型(MTP)权重加载时间,从而降低实例端到端拉起时长。 fixes [#239](https://gitcode.com/Ascend/MindIE-PyMotor/issues/239) ## **2. 修改内容** 本 PR 通过在 safetensors 权重迭代器中引入「按权重名过滤、在读盘前跳过」的能力,使草稿模型加载时只读取 MTP 相关张量。涉及以下补丁文件及组件交互: - vllm_mtp_deepseek_mtp.patch - vllm_shuffle_default_loader.patch - vllm_shuffle_weight_utils.patch - vllm_shuffle_load_config.patch - patch_apply_shuffle_safetensors.py 调用链路:DeepSeekMTP.weight_name_filter → DefaultModelLoader.Source.weight_filter → safetensors_weights_iterator(weight_filter=...) → 读盘前跳过非 MTP 权重。 ## **3. 资料变更** 不涉及。 ## **4. 接口变更** 不涉及。 ## **5. 测试结果** p端到端时长约8分钟  d端到端时长约7分钟   p中草稿模型拉起时间约30秒:  d中草稿模型拉起时间约20秒:  ## **6. CheckList** > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] [x] 代码注释完备 [x] 正确记录维测日志 [x] 是否有UT用例 [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 See merge request: Ascend/MindIE-PyMotor!423 | 1 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 25 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 1 个月前 |