| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[feature] support tune qwen blocksize Co-authored-by: zhaokerui<zhaokerui@huawei.com> # message auto-generated for no-merge-commit merge: !1035 merge dev into dev [feature] support tune qwen blocksize Created-by: zhaokerui Commit-by: zhaokerui Merged-by: Katrina-CXY Description: <!-- PR描述模板更新日期:20251225 --> # 合入背景 Fixes #622 # 修改内容 支持config文件传入的参数blockSize传入至算子的参数 # 资料变更 不涉及 # 接口变更 不涉及 # 测试结果 打点得到已经传入到算子param,curl回复正常。 # CheckList > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]。 - [x] 代码注释完备 - [x] 正确记录错误日志 - [x] 进行了返回值校验 (禁止使用void屏蔽安全函数、自研函数返回值;考虑接口的异常场景;调用底层组件接口时,需要进行返回值校验) - [x] 进行了空指针校验 - [x] 若存在资源申请,使用后资源被正确的释放了 - [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 - [x] 按照[代码仓中提供的格式模板](https://gitcode.com/Ascend/MindIE-LLM/blob/master/.clang-format),使用clang-format工具格式化代码 - [x] 符合Ascend社区的编码规范。[C++ 语言编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-coding-style-guide.md) | [C++ 语言安全编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-secure-coding-guide.md) See merge request: Ascend/MindIE-LLM!1035 | 3 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[Feature] MindIE支持Prefix Cache叠加SP Co-authored-by: chuyuelin<chuyuelin1@huawei.com> # message auto-generated for no-merge-commit merge: !21 merge prefixcache_sp_bugfix into dev [Feature] MindIE支持Prefix Cache叠加SP Created-by: chuyuelin Commit-by: chuyuelin Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20251225 --> # 合入背景 > 请描述为什么要做这个PR内的改动。\ > 如涉及,请关联前序PR或同特性/需求下的其他PR。\ > 如果是修复之前PR引入的问题,请关联引入问题的PR。\ > 注意: Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代. Fix part of #130 # 修改内容 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列。\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容)。 MindIE支持Prefix Cache叠加SP # 资料变更 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及”。 不涉及 # 接口变更 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及”。 不涉及 # 测试结果 > 请说明测试场景,测试方法以及测试结果。\ > 测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。 DeepSeek-V3.1功能、精度正常 # CheckList > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]。 - [x] 代码注释完备 - [x] 正确记录错误日志 - [x] 进行了返回值校验 (禁止使用void屏蔽安全函数、自研函数返回值;考虑接口的异常场景;调用底层组件接口时,需要进行返回值校验) - [x] 进行了空指针校验 - [x] 若存在资源申请,使用后资源被正确的释放了 - [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 - [x] 按照[代码仓中提供的格式模板](https://gitcode.com/Ascend/MindIE-LLM/blob/master/.clang-format),使用clang-format工具格式化代码 - [x] 符合Ascend社区的编码规范。[C++ 语言编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-coding-style-guide.md) | [C++ 语言安全编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-secure-coding-guide.md) See merge request: Ascend/MindIE-LLM!21 | 5 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
【新需求】GLM4.1V适配lcoc, flash comm和权重预取 Co-authored-by: pu-zhe<puzhe1@h-partners.com> # message auto-generated for no-merge-commit merge: !251 merge glm4v into dev 【新需求】GLM4.1V适配lcoc, flash comm和权重预取 Created-by: pu-zhe Commit-by: pu-zhe Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20251225 --> # 合入背景 > 请描述为什么要做这个PR内的改动。\ > 如涉及,请关联前序PR或同特性/需求下的其他PR。\ > 如果是修复之前PR引入的问题,请关联引入问题的PR。\ > 注意: Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代. GLM4.1V适配lcoc, flash comm和权重预取 Fixes [#135](https://gitcode.com/Ascend/MindIE-LLM/issues/135) # 修改内容 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列。\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容)。 重构atb_models\atb_framework\models\glm41v\layer\decoder_layer.cpp,删除冗余类,冗余函数调用 atb_models\atb_llm\models\glm41v\modeling_glm41v_text.py适配lcoc, flash comm和权重预取 atb_models\atb_llm\models\glm41v\modeling_glm41v_vit_atb.py优化VIT pos embedding计算性能 # 资料变更 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及”。 不涉及 # 接口变更 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及”。 不涉及 # 测试结果 > 请说明测试场景,测试方法以及测试结果。\ > 测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。 场景:TP2,4并发,1080P图片输入,512输出场景, 基础环境变量: export ATB_LAUNCH_KERNEL_WITH_TILING=1 export ATB_LAYER_INTERNAL_TENSOR_REUSE=1 export PYTORCH_NPU_ALLOC_CONF='max_split_size_mb:2048' export HCCL_BUFFSIZE=120 export ATB_WORKSPACE_MEM_ALLOC_GLOBAL=1 export ATB_OPERATION_EXECUTE_ASYNC=1 export TASK_QUEUE_ENABLE=1 export MINDIE_ASYNC_SCHEDULING_ENABLE=1 300I DUO(w8a8sc量化): 适配特性前,TTFT=8984.5 ms, 适配特性后,TTFT=8275.8ms,性能提升8.6% Textvqa精度: 76.48,竞品浮点精度76.46   800I A2(w8a8量化): 适配特性前,TTFT=1998.8 ms, 适配特性后TTFT=1756.8ms,性能提升13.8% (增加环境变量: export ATB_OPERATION_EXECUTE_ASYNC=2,export HCCL_OP_EXPANSION_MODE="AIV") Textvqa精度:75.97,竞品浮点精度76.46   # CheckList > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]。 - [x] 代码注释完备 - [x] 正确记录错误日志 - [x] 进行了返回值校验 (禁止使用void屏蔽安全函数、自研函数返回值;考虑接口的异常场景;调用底层组件接口时,需要进行返回值校验) - [x] 进行了空指针校验 - [x] 若存在资源申请,使用后资源被正确的释放了 - [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 - [x] 按照[代码仓中提供的格式模板](https://gitcode.com/Ascend/MindIE-LLM/blob/master/.clang-format),使用clang-format工具格式化代码 - [x] 符合Ascend社区的编码规范。[C++ 语言编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-coding-style-guide.md) | [C++ 语言安全编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-secure-coding-guide.md) See merge request: Ascend/MindIE-LLM!251 | 7 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
[Feature]:使能LayerwiseDisaggregated边云协同推理特性前提下, 支持配置使能多机推理特性和2p下发的计算图适配 Co-authored-by: kk1994<kangkai31@huawei.com> # message auto-generated for no-merge-commit merge: !372 merge dev into dev [Feature]:使能LayerwiseDisaggregated边云协同推理特性前提下, 支持配置使能多机推理特性和2p下发的计算图适配 Created-by: kk1994 Commit-by: kk1994 Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20251225 --> # 合入背景 > 请描述为什么要做这个PR内的改动。\ > 如涉及,请关联前序PR或同特性/需求下的其他PR。\ > 如果是修复之前PR引入的问题,请关联引入问题的PR。\ > 注意: Fixes #ISSUE ID会自动关闭issue,如问题部分解决请不要使用Fixes,可以用Fix part of #ISSUE ID替代. Fix part of #150 Fix part of #140 # 修改内容 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列。\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容)。 计算图当前的代码仅适配了DP=1的情况,且编写时新增的部分代码在编写时未考虑到DP>1的情况,需要对上述代码进行检查,对不支持DP=2的代码进行适配。同时需要适配支持QKVDownDP优化。 主要调整包括: 1、DP开启后计算图有变化,当前代码存在未修改DP>1成立的分支,需要进行检查适配。 2、需要对QKVDownDP优化进行适配。 QKVDownDP通过在MOE层中更改AllGather位置起到优化。开启后从MoE第一层至倒数第二层,输出的hidden为未进行AllGather的数据,只有最后一层输出之前会AllGather。由于边侧和云侧卡数不同,为保证边云之间传输正确的hidden,需要在云侧最后一层输出执行了AllGather后的hidden。QKVDownDP在边云场景中应只作用于MoE第一层至云侧倒数第二层。 需要在decoder_model和decoder_layer中新增参数,用于判断是否为云侧最后一层。将QKVDownDP的操作限制在云测最后一层之前。 decoder_model和decoder_layer中的InferShape函数需要对输出的shape进行相应的适配。 # 资料变更 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及”。 不涉及 # 接口变更 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及”。 不涉及 # 测试结果 > 请说明测试场景,测试方法以及测试结果。\ > 测试用例设计时需考虑硬件、部署方式、功能、性能、精度、显存等维度。 测试针对集中式/分布式/2P/多机均进行了测旧测新 # CheckList > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x]。 - [x] 代码注释完备 - [x] 正确记录错误日志 - [x] 进行了返回值校验 (禁止使用void屏蔽安全函数、自研函数返回值;考虑接口的异常场景;调用底层组件接口时,需要进行返回值校验) - [x] 进行了空指针校验 - [x] 若存在资源申请,使用后资源被正确的释放了 - [x] 若涉及多线程场景,考虑了并发场景,不存在死锁问题 - [x] 按照[代码仓中提供的格式模板](https://gitcode.com/Ascend/MindIE-LLM/blob/master/.clang-format),使用clang-format工具格式化代码 - [x] 符合Ascend社区的编码规范。[C++ 语言编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-coding-style-guide.md) | [C++ 语言安全编程指导](https://gitcode.com/Ascend/community/blob/master/docs/contributor/Ascend-cpp-secure-coding-guide.md) See merge request: Ascend/MindIE-LLM!372 | 6 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Co-authored-by: taojiovvo<jitao12@huawei.com> # message auto-generated for no-merge-commit merge: !546 merge revert-mr-472-1773147105607-auto into dev 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Created-by: taojiovvo Commit-by: taojiovvo Merged-by: taojiovvo Description: 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 See merge request: Ascend/MindIE-LLM!546 | 6 个月前 | |
【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Co-authored-by: taojiovvo<jitao12@huawei.com> # message auto-generated for no-merge-commit merge: !546 merge revert-mr-472-1773147105607-auto into dev 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Created-by: taojiovvo Commit-by: taojiovvo Merged-by: taojiovvo Description: 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 See merge request: Ascend/MindIE-LLM!546 | 6 个月前 | |
[dev]Synchronize code Co-authored-by: forcekeng<gengli8@huawei.com> | 8 个月前 | |
【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Co-authored-by: taojiovvo<jitao12@huawei.com> # message auto-generated for no-merge-commit merge: !546 merge revert-mr-472-1773147105607-auto into dev 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 Created-by: taojiovvo Commit-by: taojiovvo Merged-by: taojiovvo Description: 【revert】[RFC]: MindIE-LLM 日志模块整改——DeepSeek&Qwen模型cpp 日志接口替换 See merge request: Ascend/MindIE-LLM!546 | 6 个月前 |