| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
【msmodelslim】cleancode Co-authored-by: caishengcheng<caishengcheng@huawei.com> | 7 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
【msmodelslim】代码回合 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !26 merge code into master 【msmodelslim】代码回合 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】代码回合 See merge request: Ascend/msmodelslim!26 | 6 个月前 | |
【feature】DeepSeek-V4-Pro 支持 w4a8和w8a8量化 Co-authored-by: zhangz200102<zhangzheng183@huawei.com> Co-authored-by: rookie_hongchuan<hongchuan6@h-partners.com> # message auto-generated for no-merge-commit merge: !566 merge merge/support-dsv4-pro-mtp-refactor into master 【feature】DeepSeek-V4-Pro 支持 w4a8和w8a8量化 Created-by: zhangz200102 Commit-by: zhangz200102;rookie_hongchuan Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/appendix/CONTRIBUTING.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/developer_guide/integrating_models/) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) **修改目的:**(本 PR 要达成什么目标) 支持DeepSeek-V4-Pro w4a8和w8a8量化 **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) (在此填写) **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 在此粘贴可复现命令 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT**  - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!566 | 1 个月前 | |
【msmodelslim】【feature】支持默认结构的离群值抑制 Co-authored-by: anreywmh<18845895998@163.com> # message auto-generated for no-merge-commit merge: !142 merge w_dev_default_anti into master 【msmodelslim】【feature】支持默认结构的离群值抑制 Created-by: anreywmh Commit-by: anreywmh Merged-by: ascend-robot Description: 【msmodelslim】【feature】支持默认结构的离群值抑制 See merge request: Ascend/msmodelslim!142 | 4 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
Glm-4.6V模型W8A8量化适配【part1】增加Glm-4.6V模型适配器与推荐实践 Co-authored-by: xiaoheng181<eudemoniaxh@163.com> # message auto-generated for no-merge-commit merge: !209 merge master_glm46v_code into master Glm-4.6V模型W8A8量化适配【part1】增加Glm-4.6V模型适配器与推荐实践 Created-by: xiaoheng181 Commit-by: xiaoheng181 Merged-by: ascend-robot Description: 增加Glm-4.6V模型适配器与推荐实践 config/config.ini lab_practice/glm4_6v/glm4_6v_w8a8.yaml msmodelslim/model/glm4_6v/\_\_init\_\_.py msmodelslim/model/glm4_6v/model_adapter.py msmodelslim/model/glm4_6v/moe_utils.py See merge request: Ascend/msmodelslim!209 | 4 个月前 | |
【bugfix】支持GLM4MOE模型的MTP(Multi-Token Prediction)接入 Co-authored-by: qq_46439621<wanlongze1@huawei.com> # message auto-generated for no-merge-commit merge: !398 merge glm4moe_mtp_fix_0512 into master 【bugfix】支持GLM4MOE模型的MTP(Multi-Token Prediction)接入 Created-by: qq_46439621 Commit-by: qq_46439621 Merged-by: ascend-robot Description: ## PR 提交说明 **PR 标题:** [Bugfix] 支持 GLM4MOE 模型的 MTP(Multi-Token Prediction)接入 --- ### 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 --- ### 2. 修改描述 **修改背景:** GLM4MOE 量化流程当前仅覆盖基础 Decoder Layer,未对 MTP(Multi-Token Prediction)层执行量化,导致 MTP 层权重保持 FP16、无法导出统一量化模型。 **修改目的:** 使 GLM4MOE 模型适配器完整支持 MTP 层的量化接入,包括层发现、子图构造、LN-线性融合映射、旋转映射,开箱即用。 **修改内容:** - **core/模型适配**:重写 init_model,从 safetensors 加载 MTP 解码器权重并注入已有 HF 模型的最末层;重写 generate_model_visit / generate_model_forward,在 Decoder Layer 遍历基础上追加 MTP 层子图访问与前向过程;新增 mtp_preprocess、generate_decoder_layer、load_decoder_if_not_exist、load_mtp_if_not_load 等辅助方法。 - **core/算子**:新增 mtp_quant_module.py,实现 MTPLayer、SharedHead、GLM4MoeRMSNorm 等 MTP 子模块定义,以及 wrap_mtp_decoder、remove_zero_and_shift 等权重重排/装配工具。 - **core/子图 & 融合映射**:更新 get_adapter_config_for_subgraph 为 MTP 层补齐 Subgraph→AdapterConfig;更新 glm4_moe_get_ln_fuse_map 和 glm4_moe_get_rotate_map,新增 MTP 层的 Layernorm-Linear 融合及 QuaRot 旋转映射项。 - **infra/模型适配**:__init__.py 显式导出 GLM4MoeModelAdapter,修复直接 import 不可用的问题。 - **app/量化实践**:YAML 配置移除无效 runner 字段、为第 92 层(MTP 层)各量化 config 增加 exclude 排除项,避免与新增的 MTP 子图量化冲突。 - **test**:扩展 UT 用例,修复 test_init_model Mock 适配新的模型加载路径;新增 test_get_adapter_config_for_subgraph_with_mtp_then_include_mtp_layer 验证 MTP 层子图数量。 --- ### 3. 功能验证 **量化命令:** bash export ASCEND_RT_VISIBLE_DEVICES=15 msmodelslim quant \ --model_path /home/weights/GLM-4.7 \ --save_path /home/weights/GLM-4.7-W8A8-MTP \ --device npu \ --model_type GLM-4.7 \ --quant_type w8a8 \ --trust_remote_code True 服务化命令 bash export ASCEND_RT_VISIBLE_DEVICES=8,9,10,11,12,13,14,15 vllm serve /home/weights/GLM-4.7-W8A8-MTP \ --served-model-name glm-4.7-w8a8-mtp \ --trust-remote-code \ --quantization ascend \ --port 8802 \ --tensor-parallel-size 8 \ --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}' \ --tool-call-parser glm45 \ --reasoning-parser glm45 \ --enable-auto-tool-choice \ --additional-config '{"ascend_scheduler_config": {"enable": true}}' **测试镜像:vllm v0.18.0rc1-a3** 模型量化后,MTP采信率正常  因为是bugfix,这里稍微做一下精度验证: **AIME2025**:精度达标 标杆95.3  --- ### 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [x] 是否具备 UT 测试用例看护(路径:test/cases/model/glm4_moe/test_model_adapter_glm4_moe.py;已随 commit 扩展用例) - [ ] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!398 | 1 个月前 | |
【bugfix】修复glm47-flash的yaml格式错误 Co-authored-by: qq_46439621<wanlongze1@huawei.com> # message auto-generated for no-merge-commit merge: !688 merge sglang_test into master 【bugfix】修复glm47-flash的yaml格式错误 Created-by: qq_46439621 Commit-by: qq_46439621 Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md ,开发者文档: https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models PR 标题前缀:[Bugfix] ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** 使用 msmodelslim quant 命令对 GLM-4.7-Flash 模型进行 W8A8 量化时,出现 SchemaValidateError 错误,提示 metadata.verified_model_types 字段应为列表类型,但实际接收到的是字典类型。 **修改目的:** 修复 GLM-4.7-Flash 模型量化配置文件中的字段名错误,确保量化流程正常执行。 **修改内容:** - infra/yaml_practice: 修正 lab_practice/glm4_moe_lite/glm4_moe_lite_w8a8.yaml 配置文件中的字段名错误,将错误的 verified_model_types 字段更正为 verified_tags,与 PracticeConfig 模型定义保持一致。 ## 3. 功能验证 - [ ] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤:** bash # 修复前命令报错 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu:0 \ --model_type GLM-4.7-Flash \ --quant_type w8a8 \ --trust_remote_code True # 修复后命令正常执行 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(YAML 配置文件字段名已校验) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景(不适用) - [x] 是否已对正则表达式做 ReDos 检查(不适用) **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!688 | 1 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
【msmodelslim】【Feature】support hy3 w8a8 quant Co-authored-by: anreywmh<18845895998@163.com> # message auto-generated for no-merge-commit merge: !712 merge hy_3.0_a2_a3 into master 【msmodelslim】【Feature】support hy3 w8a8 quant Created-by: anreywmh Commit-by: anreywmh Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) 0Day 支持HY3 W8A8 量化 **修改目的:**(本 PR 要达成什么目标) 0Day 支持HY3 W8A8 量化 **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 1、接入HY3 model_adpter.py 2、给出HY3 W8A8量化最佳实践 3、补充支持HY3 W8A8量化资料 关键细节: 1、checkpoint中mlp.experts.*.gate_proj.weight + up_proj.weight是独立的, from_pretrained 读 safetensors 时被 fuse 为 gate_up_proj 是Parameter 的,无法量化需要转换 .解决手段:在量化某一 decoder layer 之前,如果该层的 MLP 还是 融合 MoE 结构,就先把它拆成逐专家的 nn.Linear,否则 linear_quant 无法按专家粒度量化,量化到第 N 层时才拆第 N 层的 MoE,有利于控制显存峰值。Hy3 约有 192 个专家,单层 MoE 权重量很大。在 NPU 上做 copy_ 通常比 CPU 更快。注意要将transformers处理后的e_score_correction_bias、shared_experts和gate,变为expert_bias、shared_mlp和router.gate 2、mtp在model.layers.80,但是config.num_hidden_layers等于80,需要处理MTP和mlp_layer_types 3、e_score_correction_bias要从buffer转为Parameter 4、mlp.gate要回退 5、名字得换回去: model.layers.1.mlp.expert_bias - model.layers.1.mlp.router.gate.weight - model.layers.1.mlp.shared_mlp.down_proj.weight - model.layers.1.mlp.shared_mlp.gate_proj.weight - model.layers.1.mlp.shared_mlp.up_proj.weight **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。  md5值一致  - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash msmodelslim quant \ --model_path ${model_path} \ --save_path ${save_path} \ --device npu \ --model_type Hy3 \ --quant_type w8a8 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 NA - [ ] 是否未采集或打印敏感信息 NA - [ ] 是否已正确设置文件权限 NA - [ ] 是否充分考虑浮点运算溢出、除零等异常场景 NA - [ ] 是否已对正则表达式做 ReDos 检查 NA **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) NA - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) NA See merge request: Ascend/msmodelslim!712 | 19 天前 | |
[feature]适配internvl-38B模型w8a8 Co-authored-by: 李明宇<limingyu35@h-partners.com> # message auto-generated for no-merge-commit merge: !484 merge master-internvl-dense-0602 into master [feature]适配internvl-38B模型w8a8 Created-by: code_mingming Commit-by: code_mingming;李明宇 Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 Thanks for sending a pull request! BEFORE SUBMITTING, PLEASE READ [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md). ## PR描述 (What this PR does / why we need it?) 适配internvl-38B模型w8a8量化 ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 请确认CI已通过增量及存量的单元测试用例。 如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤(最好提供完整的可复现的操作路径及关键截图),以便Committer能够快速复现验证,也便于后续的维护。 如果未添加测试,请说明未添加的原因,以及为何难添加测试。 - [_] 功能自验 - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 CI passed with new added/existing test. If it was tested in a way different from regular unit tests, please clarify how you tested step by step, ideally copy and paste-able, so that other reviewers can test and check, and descendants can verify in the future. If tests were not added, please describe why they were not added and/or why it was difficult to add. - [_] Self-verification of the feature. - [_] Screenshot of local self-verification (please anonymize any sensitive information such as personal identifiers) - [_] Have new or modified unit test (UT) cases been added or adapted to cover the newly added or changed content? See merge request: Ascend/msmodelslim!484 | 1 个月前 | |
[feature]适配internvl-moe模型w8a8 Co-authored-by: 李明宇<limingyu35@h-partners.com> # message auto-generated for no-merge-commit merge: !486 merge master-internvl-moe into master [feature]适配internvl-moe模型w8a8 Created-by: code_mingming Commit-by: 李明宇 Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 Thanks for sending a pull request! BEFORE SUBMITTING, PLEASE READ [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md). ## PR描述 (What this PR does / why we need it?) 适配internvl-moe模型w8a8量化 ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 请确认CI已通过增量及存量的单元测试用例。 如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤(最好提供完整的可复现的操作路径及关键截图),以便Committer能够快速复现验证,也便于后续的维护。 如果未添加测试,请说明未添加的原因,以及为何难添加测试。 - [_] 功能自验 - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 CI passed with new added/existing test. If it was tested in a way different from regular unit tests, please clarify how you tested step by step, ideally copy and paste-able, so that other reviewers can test and check, and descendants can verify in the future. If tests were not added, please describe why they were not added and/or why it was difficult to add. - [_] Self-verification of the feature. - [_] Screenshot of local self-verification (please anonymize any sensitive information such as personal identifiers) - [_] Have new or modified unit test (UT) cases been added or adapted to cover the newly added or changed content? See merge request: Ascend/msmodelslim!486 | 1 个月前 | |
【msmodelslim】代码回合 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !26 merge code into master 【msmodelslim】代码回合 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】代码回合 See merge request: Ascend/msmodelslim!26 | 6 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Feature] add mimo-v2-flash-w8a8 quant adapter Co-authored-by: Kingbo_998<jingbo_gao@163.com> # message auto-generated for no-merge-commit merge: !384 merge master into master [Feature] add mimo-v2-flash-w8a8 quant adapter Created-by: Kingbo_998 Commit-by: Kingbo_998 Merged-by: ascend-robot Description: ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** msModelSlim 当前缺少 MiMo-V2-Flash 模型的量化适配。 **修改目的:** 新增 MiMo-V2-Flash 模型适配器及 W8A8 量化配置,使该模型能够接入 msModelSlim 量化流程,并在降低模型加载内存占用的情况下完成量化。 **修改内容:** - infra/模型适配:新增 mimo_v2_flash 模型适配器,实现模型初始化、数据处理、逐层加载、模型遍历和前向流程。 - infra/模型注册:在 config/config.ini 中注册 MiMo-V2-Flash 模型名称、适配器加载入口及 transformers==4.57.6 依赖。 - infra/逐层加载:根据权重索引按需加载 Decoder Layer,支持 MiMo-V2-Flash 的 Hybrid Attention 和 MoE/MLP 混合层结构。 - app/最佳实践量化:新增 lab_practice/mimo_v2/mimo-v2-flash-w8a8.yaml,提供 per-token 激活量化和 per-channel 权重量化的 W8A8 配置。 - utils/安全校验:模型路径和权重索引分别通过 get_valid_read_path、json_safe_load 进行读取与校验。 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写“冒烟是否通过”。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) msmodelslim quant --device npu --model_path ./MiMo-V2-Flash-BF16/ --save_path ./MiMo-V2-Flash-w8a8/ --model_type MiMo-V2-Flash --config_path ./config.yaml --trust_remote_code True **验证结果:** - MiMo-V2-Flash 模型能够正常识别并加载对应适配器。 - W8A8 量化流程可以正常执行并导出量化模型。 - 量化模型精度已完成自验,与 BF16 基线精度对齐。 - 逐层加载流程运行正常,可以按需加载 Decoder Layer。 **验证配置:** text lab_practice/mimo_v2/mimo-v2-flash-w8a8.yaml ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据:模型路径和权重索引使用项目安全接口进行校验和读取。 - [x] 是否未采集或打印敏感信息:未采集或打印用户敏感信息。 - [ ] N/A:是否已正确设置文件权限。本次修改未新增文件写入和权限设置逻辑。 - [ ] N/A:是否充分考虑浮点运算溢出、除零等异常场景。本次修改未新增相关数值计算逻辑。 - [ ] N/A:是否已对正则表达式做 ReDoS 检查。本次修改未使用正则表达式。 **DT** - [ ] N/A:是否具备 UT 测试用例看护。本次未新增 UT;适配验证依赖完整 MiMo-V2-Flash 权重及 NPU 量化环境,已通过真实模型量化、精度对比和 CI 门禁进行验证。 - [x] 是否需要添加冒烟:否,现有 CI 门禁及模型量化自验已覆盖本次适配的主要流程。 See merge request: Ascend/msmodelslim!384 | 5 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
【msmodelslim】代码回合 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !26 merge code into master 【msmodelslim】代码回合 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】代码回合 See merge request: Ascend/msmodelslim!26 | 6 个月前 | |
【msmodelslim】代码回合 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !26 merge code into master 【msmodelslim】代码回合 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】代码回合 See merge request: Ascend/msmodelslim!26 | 6 个月前 | |
【msmodelslim】cleancode Co-authored-by: caishengcheng<caishengcheng@huawei.com> | 7 个月前 | |
Qwen2.5 Omni模型W8A8量化适配【part5】更新config.ini和lab_practice,增加legacy datasetloader单元测试 Co-authored-by: xiaoheng181<eudemoniaxh@163.com> # message auto-generated for no-merge-commit merge: !140 merge qwen2_5_omni_pr5 into master Qwen2.5 Omni模型W8A8量化适配【part5】更新config.ini和lab_practice,增加legacy datasetloader单元测试 Created-by: xiaoheng181 Commit-by: xiaoheng181 Merged-by: ascend-robot Description: 更新config.ini和lab_practice,增加legacy datasetloader单元测试 config/config.ini lab_practice/qwen2_5_omni_thinker/qwen2_5_omni_thinker_w8a8.yaml test/cases/infra/test_legacy_directory_dataset_loader.py See merge request: Ascend/msmodelslim!140 | 5 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[docs] convert docs Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !552 merge converts_docs into master [docs] convert docs Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/appendix/CONTRIBUTING.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/developer_guide/integrating_models/) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) **修改目的:**(本 PR 要达成什么目标) **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) (在此填写) **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [ ] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 在此粘贴可复现命令 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [ ] 是否已校验外部数据 - [ ] 是否未采集或打印敏感信息 - [ ] 是否已正确设置文件权限 - [ ] 是否充分考虑浮点运算溢出、除零等异常场景 - [ ] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!552 | 1 个月前 | |
[Feature] Add Qwen3.6-27B-w8a8 quantization config Co-authored-by: A_J_F<wangruiqing6@h-partners.com> # message auto-generated for no-merge-commit merge: !748 merge master into master [Feature] Add Qwen3.6-27B-w8a8 quantization config Created-by: A_J_F Commit-by: A_J_F Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):** 现有Qwen3.6-Dense-w8a8的量化配置中没有对qkvz量化 **修改目的:** 新增Qwen3.6-27B-w8a8的量化配置,提升Qwen3.6-27B-w8a8性能 **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 新增Qwen3.6-27B-w8a8的量化配置,在Qwen3.6-Dense-w8a8量化的基础上,增加了对qkvz的量化。 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash msmodelslim quant --model_path ${MODEL_PATH} --save_path ${SAVE_PATH} --device npu --model_type Qwen3.6-27B --quant_type w8a8 --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [x] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!748 | 16 天前 | |
补充Qwen3-30B 一键量化配置 Co-authored-by: keith_wa<keith_wwa@163.com> # message auto-generated for no-merge-commit merge: !261 merge add_v0_cmd_qwen3_30B into master 补充Qwen3-30B 一键量化配置 Created-by: keith_wa Commit-by: keith_wa Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 Thanks for sending a pull request! BEFORE SUBMITTING, PLEASE READ [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md). ## PR描述 (What this PR does / why we need it?) - 请明确说明您提交PR的变更内容。本部分旨在概述所做的变更,以及此PR是如何解决该问题的。请尽可能地提供有助于评审人员更高效、更快速完成检视审查的实用说明。 补充Qwen3-30B 一键量化配置 - 请说明为何需要这些更改,例如具体的使用场景或bug描述。 由于V0量化已不再演进,新增模型均需支持一键量化。 - 关联issue号(如果有)。 - Please clarify what changes you are proposing. The purpose of this section is to outline the changes and how this PR fixes the issue. If possible, please consider writing useful notes for better and faster reviews in your PR. - Please clarify why the changes are needed. For instance, the use case and bug description. - Related issue number (if any) ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 请确认CI已通过增量及存量的单元测试用例。 如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤(最好提供完整的可复现的操作路径及关键截图),以便Committer能够快速复现验证,也便于后续的维护。 如果未添加测试,请说明未添加的原因,以及为何难添加测试。 - [_] 功能自验 - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 执行命令 msmodelslim quant --model_path {} --save_path {} --model_type Qwen3-30B --quant_type w8a8 --trust_remote_code True 生成如下权重:  使用mstool 工具验证两份权重差异:  CI passed with new added/existing test. If it was tested in a way different from regular unit tests, please clarify how you tested step by step, ideally copy and paste-able, so that other reviewers can test and check, and descendants can verify in the future. If tests were not added, please describe why they were not added and/or why it was difficult to add. - [_] Self-verification of the feature. - [_] Screenshot of local self-verification (please anonymize any sensitive information such as personal identifiers) - [_] Have new or modified unit test (UT) cases been added or adapted to cover the newly added or changed content? See merge request: Ascend/msmodelslim!261 | 4 个月前 | |
【msmodelslim】修改qwen3-next的yaml Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !36 merge qwen3-next into master 【msmodelslim】修改qwen3-next的yaml Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】修改qwen3-next的yaml See merge request: Ascend/msmodelslim!36 | 6 个月前 | |
【msmodelslim】【feature】msModelSlim 支持 Qwen3-Omni-30B-A3B-Thinking、Qwen3-Omni-30B-A3B-Instruct W8A8量化 Co-authored-by: anreywmh<18845895998@163.com> # message auto-generated for no-merge-commit merge: !147 merge w_qwen3_omni_moe into master 【msmodelslim】【feature】msModelSlim 支持 Qwen3-Omni-30B-A3B-Thinking、Qwen3-Omni-30B-A3B-Instruct W8A8量化 Created-by: anreywmh Commit-by: anreywmh Merged-by: ascend-robot Description: 【msmodelslim】【feature】msModelSlim 支持 Qwen3-Omni-30B-A3B-Thinking、Qwen3-Omni-30B-A3B-Instruct W8A8量化 See merge request: Ascend/msmodelslim!147 | 5 个月前 | |
【Feature】增加qwen3-vl-embedding量化适配 Co-authored-by: wangyongjun<wangyongjun7@huawei.com> # message auto-generated for no-merge-commit merge: !510 merge add_qwen3_vl_embedding into master 【Feature】增加qwen3-vl-embedding量化适配 Created-by: wangyongjun Commit-by: wangyongjun Merged-by: ascend-robot Description: ## 1. 影响面评估 - **接口变更(按需):** 无 - **输出件变更(按需):** 无 - **非兼容变更(按需):** 无 - **SIG 评审结论(按需):** 无 --- ## 2. 修改描述 - **修改背景(可选):** 300I_Duo卡上支持qwen3-vl-embedding和reranker模型w8a8量化推理 - **修改目的:** qwen3-vl-embedding和reranker支持w8a8量化 - **修改内容:** - msmodelslim/model/qwen3_vl/model_adapter.py:对于qwen3-vl-embedding-2b模型不存在model.safetensors.index.json文件,_get_weight_map函数适配,适配从权重目录中的safetensors文件构造weight_map - lab_practice/qwen3_vl/qwen3_vl_embedding_w8a8.yaml:新增qwen3-vl-embedding和reranker量化最近实践配置文件 - example/multimodal_vlm/Qwen3-VL-Embedding/README.md:新增量化指导说明 - [ ] **涉及代码双合**(关联 PR 链接):后续策略见 MR !510 --- ## 3. 功能验证 - [x] **功能自验** - [ ] **本地自验用例截图**(请勿包含个人信息;可附复现命令) --- ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] **是否已校验外部数据** — N/A - [x] **是否未采集或打印敏感信息** — N/A - [x] **是否已正确设置文件权限** — N/A - [x] **是否充分考虑浮点运算溢出、除零等异常场景** — N/A - [x] **是否已对正则表达式做 ReDos 检查** — N/A **DT** - [x] **是否具备 UT 测试用例看护**(路径:test/cases/model/qwen3_vl/test_model_adapter_qwen3_vl.py:TestQwen3VLModelAdapterGetWeightMap, TestQwen3VLModelAdapterGetWeightMapNull, TestQwen3VLModelAdapterGetWeightMapFallback) - [ ] **是否需要添加冒烟:** 否 See merge request: Ascend/msmodelslim!510 | 1 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
qwq32B w8a8 量化 Co-authored-by: ylzzz<yelinzhong@huawei.com> # message auto-generated for no-merge-commit merge: !262 merge ylzzz_qwq32b into master qwq32B w8a8 量化 Created-by: ylzzz Commit-by: ylzzz Merged-by: ascend-robot Description:   See merge request: Ascend/msmodelslim!262 | 4 个月前 | |
[feature] support step3p5-flash model_apapter and w8a8 int8 best pratice Co-authored-by: yejiajun<yejiajun4@huawei.com> # message auto-generated for no-merge-commit merge: !362 merge step3p5_adapter_and_w8a8 into master [feature] support step3p5-flash model_apapter and w8a8 int8 best pratice Created-by: yejiajun Commit-by: yejiajun Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 ## PR描述 (What this PR does / why we need it?) 为 Step-3.5-Flash 模型提供 msmodelslim 量化支持,包括模型适配器、MoE 层转换工具、MTP 层实现以及 W8A8 最佳实践配置。 Step-3.5-Flash 是 MoE(Mixture-of-Experts)架构模型,权重以 experts 合并形式存储(单权重张量含多个 expert),无法直接被线性量化算子处理。需要通过适配器中的 moe_utils代码将合并格式转换为展开的独立 expert 结构,才能正确量化。 - **ModelAdapter** ( Step3_5FlashModelAdapter):实现量化所需的各接口,驱动 layer-wise 前向和子图配置 - **MoE Utils** (moe_utils.py):提供 Step3p5MoEMLPWithUnpackExperts 类及转换函数,将合并的 MoELinear 权重展开为 nn.ModuleList 形式,适配线性量化流程 - **MTP Module** (step3p5_mtp.py):自定义 Multi-Token Prediction 层组件(RotaryEmbedding、RMSNorm、Attention、SharedHead),用于扩展模型层数,用于保存mtp层权重 - **Best Practice** (step3_5_moe_w8a8.yaml):定义 W8A8 量化配置,仅对 *moe.experts* 层应用 linear_quant,使用 ascendv1_saver 导出 ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 相关权重已在modelscope平台上传,https://www.modelscope.cn/models/Eco-Tech/Step-3.5-Flash-w8a8-mtp/summary  - [_] 功能自验 - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 See merge request: Ascend/msmodelslim!362 | 2 个月前 | |
【msmodelslim】cleancode Co-authored-by: caishengcheng<caishengcheng@huawei.com> | 7 个月前 | |
[Bugfix] modify 950 tag and delete mxfp in support table Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !774 merge docs into master [Bugfix] modify 950 tag and delete mxfp in support table Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) **建议标题:** [Bugfix][26.1.0] modify 950 tag and delete mxfp in support table ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** --tag 硬件场景标签由 Atlas_A5_Interface 统一更名为 Ascend_950;使用旧标签将无法匹配对应 lab_practice 配置,需改用 Ascend_950。原Atlas_350 tag下新增 Ascend_950。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 昇腾 950 相关场景标签命名不统一(Atlas_350、Atlas_A5_Interface),且 example 支持矩阵表中对外展示了 mxfp 字样,需与产品命名及对外表述对齐。 **修改目的:** 统一硬件场景标签为 Ascend_950,并清理支持矩阵表中的 mxfp 展示文案。 **修改内容:** - lab_practice:相关 YAML 的 verified_tags 中 Atlas_350 / Atlas_A5_Interface 统一改为 Ascend_950 - example:GLM-5、MiniMax-M2、LongCat-Flash、Qwen3-VL-MoE、QwenImageEdit 等 README 支持矩阵去掉 mxfp 字样,示例命令 --tag 同步为 Ascend_950 - docs:中英文一键量化 usage 文档的 tag 硬件形态说明补充 Ascend_950 - cli / app / core:命令行帮助与注释中的硬件 tag 示例更新为 Ascend_950(匹配逻辑仍为大小写不敏感字符串匹配,无接口行为变更) ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 使用新硬件标签匹配最佳实践配置(示例) msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type GLM-5.1 \ --quant_type w4a4c8 \ --tag vLLM_Ascend Ascend_950 \ --trust_remote_code True ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A:无新增外部输入处理) - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(N/A:本次仅为标签命名与文档表述调整;26.1.0 分支无 gemma4 相关用例文件) - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!774 | 7 天前 | |
【msmodelslim】刷新文件头部声明和版权 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !28 merge license into master 【msmodelslim】刷新文件头部声明和版权 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】刷新文件头部声明和版权 See merge request: Ascend/msmodelslim!28 | 6 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 7 个月前 | ||
| 7 天前 | ||
| 6 个月前 | ||
| 1 个月前 | ||
| 4 个月前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 4 个月前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 19 天前 | ||
| 1 个月前 | ||
| 1 个月前 | ||
| 6 个月前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 5 天前 | ||
| 7 天前 | ||
| 2 天前 | ||
| 6 个月前 | ||
| 6 个月前 | ||
| 7 个月前 | ||
| 5 个月前 | ||
| 7 天前 | ||
| 1 个月前 | ||
| 16 天前 | ||
| 4 个月前 | ||
| 6 个月前 | ||
| 5 个月前 | ||
| 1 个月前 | ||
| 7 天前 | ||
| 7 天前 | ||
| 4 个月前 | ||
| 2 个月前 | ||
| 7 个月前 | ||
| 7 天前 | ||
| 6 个月前 |