MindStudio-ModelSlim(msModelSlim)是MindStudio全流程工具链推出的模型量化压缩工具。
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
[Doc] 重组中文资料目录并同步导航与链接 Co-authored-by: joejoezhou<zhourongchen1@huawei.com> # message auto-generated for no-merge-commit merge: !761 merge feature/docs-dirs into master [Doc] 重组中文资料目录并同步导航与链接 Created-by: joejoezhou Commit-by: joejoezhou Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [贡献指南](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/knowledge_base/model/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 中文资料目录层级混乱,流程与概念混杂,导航与相对链接随历史迁移积累了失效路径。 **修改目的:** 重组 docs/zh 目录结构,统一以流程指南/知识库/案例参考三类文档分层,并同步导航、索引与全库相关链接。 **修改内容:** - docs:新增推理加速知识库 knowledge_base,按 knowledge_base / user_guide / contributing / api_reference / best_practices / legal 重组中文资料 - docs:每个算法单独子目录、每个调优策略单独子目录、每个量化格式单独子目录 - docs:更新流程指南,区分业务流程和工具使用流程;算法总览补齐子算法 - docs:修复迁移后失效/过时链接,同步 mkdocs 导航(仅改路径,顶层序号与 master 一致) - docs:按评审意见修正相对路径、书名号外层、文档链接书名号与完整句句号 - docs:PR 模板中模型接入路径对齐新目录;清除 V0 案例残留 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A) - [x] 是否未采集或打印敏感信息(N/A) - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因):文档重组,无代码逻辑变更,不新增 UT - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!761 | 9 天前 | |
【msmodelslim】刷新文件头部声明和版权 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !28 merge license into master 【msmodelslim】刷新文件头部声明和版权 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】刷新文件头部声明和版权 See merge request: Ascend/msmodelslim!28 | 6 个月前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
【重构】多模态生成模型量化服务重构wan2.2/hunyuanvideo【增加资料和配置】 Co-authored-by: xiaoheng181<eudemoniaxh@163.com> # message auto-generated for no-merge-commit merge: !495 merge sd_refactor_docs_and_examples into master 【重构】多模态生成模型量化服务重构wan2.2/hunyuanvideo【增加资料和配置】 Created-by: xiaoheng181 Commit-by: xiaoheng181 Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 Thanks for sending a pull request! BEFORE SUBMITTING, PLEASE READ [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md). ## PR描述 (What this PR does / why we need it?) - 请明确说明您提交PR的变更内容。本部分旨在概述所做的变更,以及此PR是如何解决该问题的。请尽可能地提供有助于评审人员更高效、更快速完成检视审查的实用说明。 本 PR 是多模态生成(multimodal_sd_modelslim_v1)重构的第五笔(资料),依赖 PR1~PR4 代码均已合入(或本分支已堆叠包含全部代码提交)。同步用户文档、示例与 lab 资产,使对外说明与重构后的 inference_config / dataset / 场景化 model_type 一致。 开发者指南 docs/zh/developer_guide/integrating_multimodal_generation_model.md 新增多模态生成模型接入指南(接口分区、Wan2.2 场景化结构、Hunyuan 参数桥接、双专家与校准数据约定等)。 用户指南 docs/zh/feature_guide/quick_quantization_v1/usage.md 补充/调整一键量化中 inference_config、dataset、多模态 SD 相关说明。 示例 example/multimodal_sd/Wan2_2/README.md Wan2.2 场景化 model_type 与配置示例说明。 Lab lab_calib/wan2_2_*、lab_calib/hunyuanvideo/ 分场景校准数据索引与样例图。 Lab lab_practice/wan2_2/*.yaml、lab_practice/hunyuan_video/*.yaml 与 inference_config / dataset 对齐的实践配置。 配置 config/config.ini 与 Wan2.2 场景化 model_type、loader 注册等保持一致。 - 请说明为何需要这些更改,例如具体的使用场景或bug描述。 代码 PR 单独合入后,用户若仍按旧 model_config 文档操作易配置失败;本 PR 将接入方式、YAML 样例与 lab 资产一次性对齐,降低合入后的使用成本。 依赖:请在 PR1~PR4 全部合入 master 后再合本 PR(或确认 target 分支已包含全部代码变更)。 - 关联issue号(如果有)。 - Please clarify what changes you are proposing. The purpose of this section is to outline the changes and how this PR fixes the issue. If possible, please consider writing useful notes for better and faster reviews in your PR. - Please clarify why the changes are needed. For instance, the use case and bug description. - Related issue number (if any) ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 有(文档与示例层面)。 新增/更新面向用户的 Markdown 说明与 lab YAML、校准数据索引。 无 生产 Python 逻辑变更;行为以已合入的代码 PR 为准。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 请确认CI已通过增量及存量的单元测试用例。 如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤(最好提供完整的可复现的操作路径及关键截图),以便Committer能够快速复现验证,也便于后续的维护。 如果未添加测试,请说明未添加的原因,以及为何难添加测试。 - [_] 功能自验 - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 CI passed with new added/existing test. If it was tested in a way different from regular unit tests, please clarify how you tested step by step, ideally copy and paste-able, so that other reviewers can test and check, and descendants can verify in the future. If tests were not added, please describe why they were not added and/or why it was difficult to add. - [_] Self-verification of the feature. - [_] Screenshot of local self-verification (please anonymize any sensitive information such as personal identifiers) - [_] Have new or modified unit test (UT) cases been added or adapted to cover the newly added or changed content? See merge request: Ascend/msmodelslim!495 | 1 个月前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
【msmodelslim】目录整改后目录文件同步修改 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !38 merge dir into master 【msmodelslim】目录整改后目录文件同步修改 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】目录整改后目录文件同步修改 See merge request: Ascend/msmodelslim!38 | 6 个月前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
[Feature] :集成 Gitleaks 本地离线密钥扫描功能 Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !714 merge master0709 into master [Feature] :集成 Gitleaks 本地离线密钥扫描功能 Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature] ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):** 本 PR 在 pre-commit 阶段集成 Gitleaks 本地离线二进制扫描 **修改目的:**(本 PR 要达成什么目标) 用于在代码提交前自动检测硬编码密钥(AWS/Git/SSH/OBS 等),防止敏感凭证泄露到代码仓库。 **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 1. .pre-commit-config.yaml:新增 gitleaks-offline-scan local hook,使用本地 gitleaks 二进制执行 protect 命令,在 pre-commit 阶段对暂存文件进行密钥扫描 2. pre-commit/.gitleaks.toml:新增 Gitleaks 配置文件,继承官方内置全套检测规则(useDefault = true),并提供自定义规则、全局白名单、行内屏蔽等扩展配置示例 **概念域参考(填写提示):** - pre-commit - 密钥泄露是常见的安全风险,开发者可能在代码中硬编码 AK/SK、Token 等敏感信息 - 通过 pre-commit hook 在提交前拦截,从源头防止凭证进入 Git 历史 - 使用本地离线二进制扫描,无需网络连接,不依赖外部服务 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 在此粘贴可复现命令 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [x] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!714 | 23 天前 | |
【msmodelslim】刷新文件头部声明和版权 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !28 merge license into master 【msmodelslim】刷新文件头部声明和版权 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】刷新文件头部声明和版权 See merge request: Ascend/msmodelslim!28 | 6 个月前 | |
【msmodelslim】刷新文件头部声明和版权 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !28 merge license into master 【msmodelslim】刷新文件头部声明和版权 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】刷新文件头部声明和版权 See merge request: Ascend/msmodelslim!28 | 6 个月前 | |
[Feature][model]: Add MiniMax-M3 W8A8 quant Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !720 merge minimax_m3_master into master [Feature][model]: Add MiniMax-M3 W8A8 quant Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** MiniMax-M3(VL)是 MiniMax 最新发布的多模态大模型,采用稀疏 MoE + Dense 混合架构,支持 text/image/video 多模态输入。需要在 msmodelslim 中适配以支持 W8A8 量化。 **修改目的:** 支持 MiniMax-M3 模型的 W8A8 量化,包括 MoE 专家权重展开、RMSNorm 精度保持、稀疏注意力层检测、导出命名对齐等功能。 **修改内容:** - infra/模型适配:新增 MiniMax-M3 模型适配器,包括: - msmodelslim/model/minimax_m3/model_adapter.py — 核心适配器(layer-wise 加载、iter_smooth/QuaRot/导出等接口实现) - msmodelslim/model/minimax_m3/moe_utils.py — MoE 工具模块,将 transformers 原生 3D 专家权重展开为 per-expert nn.Linear(gate_proj/up_proj/down_proj) - msmodelslim/model/minimax_m3/loader.py — 适配器加载器 - config/config.ini — 注册 MiniMax-M3 模型类型映射 - app/最佳实践量化:新增 W8A8 最佳实践配置 lab_practice/minimax_m3/minimax_m3_w8a8.yaml,包含 iter_smooth + linear_quant 流程 - infra/子图配置:修复 iter_smooth 子图路径不匹配问题,yield 内部名而非保存名 - infra/稀疏层检测:修复 _is_sparse_layer 从自定义字段读取失败的问题,改为直接从原始 config.json 解析 sparse_attention_freq - infra/导出命名对齐:在 ascendv1_save_module_preprocess 中实现完整 SAVE 方向命名转换(model.language_model.* → language_model.model.*、mlp → block_sparse_moe、gate_proj → w1/w3/w2、vision_tower 嵌套展开、multi_modal_projector → patch_merge_mlp 等) - infra/RMSNorm 精度:将 Gemma-style RMSNorm 的 +1/-1 转换统一在 float32 精度下进行,消除 bf16 精度损失 - infra/e_score_correction_bias:修复 MoE 层 e_score_correction_bias 导出问题,buffer 转 parameter 确保被导出 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - **infra:模型适配、调优计划/历史/缓存、测评服务等** - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 量化命令 msmodelslim quant \ --model_path ${MODEL_PATH} \ --save_path ${SAVE_PATH} \ --device npu \ --model_type MiniMax-M3 \ --quant_type w8a8 \ --trust_remote_code True # 验证命令 mstool cmp --good-path ${GOOD_PATH} --eval-path ${SAVE_PATH} --backend msit ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [x] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!720 | 2 天前 | |
[Bugfix] fix: support pip install -e with single-source data directories Co-authored-by: rookie_hongchuan<hongchuan6@h-partners.com> # message auto-generated for no-merge-commit merge: !379 merge fix/pip-editable-single-datasource into master [Bugfix] fix: support pip install -e with single-source data directories Created-by: rookie_hongchuan Commit-by: rookie_hongchuan Merged-by: ascend-robot Description: ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** pip install -e . 可编辑安装后,CLI 入口通过 __file__ + ../../lab_practice 查找数据目录,但 msmodelslim/lab_practice 在源码树内不存在(数据实际在 repo 根 ./lab_practice),导致路径找不到。 **修改目的:** pip install -e . 开箱可用,支持源码调试工作流。 **修改内容:** - setup.py:develop 命令时创建符号链接 msmodelslim/{config,lab_practice,lab_calib} → ./{config,lab_practice,lab_calib},消除双份副本问题。所有平台优先尝试 os.symlink(),失败时降级 shutil.copytree() 并提示用户同步修改。安全性方面,安全模块 get_valid_read_path 内部已调 os.path.realpath() 解析符号链接,不阻塞运行 - setup.py:_ensure_data_symlinks() 内已有 copytree 残留时 shutil.rmtree 清理后重建 symlink,避免 stale 副本 ## 3. 功能验证 环境:8× Ascend 910B2,模型 Qwen3-32B(62GB, 64层) ### 3.1 pip install -e . 可编辑安装 bash $ source .venv/bin/activate $ pip install -e . --no-deps $ ls -la msmodelslim/config msmodelslim/lab_practice msmodelslim/lab_calib lrwxrwxrwx. msmodelslim/config -> ../config lrwxrwxrwx. msmodelslim/lab_practice -> ../lab_practice lrwxrwxrwx. msmodelslim/lab_calib -> ../lab_calib $ python3 -c "import msmodelslim; print(msmodelslim.__file__)" <workspace>/msmodelslim/__init__.py # 指向源码树 $ msmodelslim --help usage: msmodelslim [-h] {quant,analyze,tune} ... 结论:develop 模式正常,符号链接自动创建,__file__ 指向源码树。 ### 3.2 一键量化(Qwen3-32B W8A16, 全量 64 层) bash $ source .venv/bin/activate $ source tools/quant-env.sh $ echo y | msmodelslim quant \ --model_type Qwen3-32B \ --model_path /data/models/Qwen3_32B \ --save_path /tmp/qwen3-w8a16-test \ --device npu:0,1,2,3,4,5,6,7 \ --quant_type w8a16 # 关键日志: # Using model adapter Qwen3ModelAdapter. # Init model success # Run processor LinearQuantProcessor for "model.layers.0" ... "model.layers.63" # Save safetensors files to /tmp/qwen3-w8a16-test successfully # ===========SUCCESS=========== 结论:develop 模式下 msmodelslim 全流程正常(模型加载 → best practice → 逐层量化 → safetensors 保存均通过)。 ### 3.3 bash install.sh 常规安装 bash $ bash install.sh $ pip show msmodelslim Location: .../site-packages $ msmodelslim --help usage: msmodelslim [-h] {quant,analyze,tune} ... 结论:常规安装不受影响,包正确安装到 site-packages。 ### 3.4 交替安装(develop ↔ regular 互切) bash $ pip install -e . && pip show msmodelslim # → 源码树 $ bash install.sh && pip show msmodelslim # → site-packages 结论:可反复切换,无残留冲突。 ### 3.5 安全模块兼容性 get_valid_read_path 内部调用 os.path.realpath() 解析符号链接,仅打印 warning 不阻断,CLI 入口无需额外处理。 ## 4. 自检 **典型安全编码问题** - [x] 是否已校验外部数据:N/A,未涉及外部输入 - [x] 是否未采集或打印敏感信息:是 - [x] 是否已正确设置文件权限:N/A,符号链接继承源文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景:N/A,不涉及数值计算 - [x] 是否已对正则表达式做 ReDos 检查:N/A,不涉及正则 **DT** - [x] 是否具备 UT 测试用例看护:已有 tests/test_setup.py 相关用例 - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!379 | 1 个月前 | |
【feature】支持跨平台 gitleaks 二进制文件检测 Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !792 merge master0728 into master 【feature】支持跨平台 gitleaks 二进制文件检测 Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [贡献指南](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/knowledge_base/model/integrating_models.md) PR 标题前缀:[Feature] support cross-platform gitleaks binary in pre-commit hook ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:仅修改 .pre-commit-config.yaml 中 gitleaks hook 的 entry 命令,pre-commit 配置接口不变。 **输出件变更(按需):** 无 > 备注:不涉及输出件变更。 **非兼容变更(按需):** 无 > 备注:Linux/macOS 环境行为与原来完全一致(./gitleaks),Windows 环境新增对 gitleaks.exe 的支持,无迁移成本。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景:** 项目在 Windows 环境下运行 pre-commit 时,gitleaks 的 entry 配置为固定 ./gitleaks,但 Windows 上 gitleaks 预编译文件的名称通常为 gitleaks.exe,导致 Hook 因找不到二进制文件而失败。 **修改目的:** 让 gitleaks pre-commit hook 自动适配运行平台,支持 Windows(gitleaks.exe)和 Linux/macOS(gitleaks),确保跨平台一致性体验。 **修改内容:** - .pre-commit-config.yaml:将 gitleaks hook 的 entry 从固定的 ./gitleaks 改为 bash 脚本检测,优先执行 ./gitleaks.exe(Windows),不存在则回退到 ./gitleaks(Linux/macOS) **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** 下载和配置: 1. Linux/macOS 环境:在项目根目录下执行:wget --no-host-directories -c --no-check-certificate https://pytorch-package.obs.cn-north-4.myhuaweicloud.com/pta-codecheck/gitleaks 2. Windows 环境:从https://github.com/gitleaks/gitleaks/releases 中下载压缩包,解压后将gitleaks.exe移至项目根目录下。 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [ ] N/A 是否已校验外部数据 - [ ] N/A 是否未采集或打印敏感信息 - [ ] N/A 是否已正确设置文件权限 - [ ] N/A 是否充分考虑浮点运算溢出、除零等异常场景 - [ ] N/A 是否已对正则表达式做 ReDos 检查 **DT** - [ ] N/A 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [ ] N/A 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!792 | 4 天前 | |
【docs】资料架构重构,并将资料托管至readthedocs。 Co-authored-by: keith_wa<keith_wwa@163.com> # message auto-generated for no-merge-commit merge: !109 merge pr_docs_re_copy into master 【docs】资料架构重构,并将资料托管至readthedocs。 Created-by: keith_wa Commit-by: keith_wa Merged-by: ascend-robot Description: 1. 动机 (Motivation) 内容上: 优化导航结构:原目录结构逻辑不清晰、目录层级深且链接复杂。 提升阅读体验:原 traditional_quantization_v0 目录下存在 20+ 个零散文档,内容分布碎片化,用户难以快速建立完整的技术全景认知。 消除内容冗余:多个文档之间存在重复的依赖说明、操作流程及参数介绍,增加了维护成本及版本不一致的风险。 呈现上: 提供专业资料托管:原docs/目录结构不清晰、目录名/文档名不直观(英文),跳转繁琐且无搜索功能。 2. 修改点 (Changes) 2.1 重新梳理目录结构  2.2. 文档整合与重构 V0及传统量化核心文档合并:将 20 多个零散文档按功能维度深度整合为 10篇核心指南: # V0框架文档导航(已停止演进) 本目录文档按模型类型与任务场景重排,便于按需求快速定位。 ## 一、传统模型量化与校准 - [传统模型量化与校准](traditional_model_quantization_and_calibration.md) - 包含 PyTorch/ONNX/MindSpore 训练后量化与 QAT。 ## 二、大模型量化与压缩 - [大模型量化与校准](foundation_model_quantization_and_calibration.md) - 包含低显存量化、混合校准数据集、FA3 量化。 - [压缩与结构优化(大模型为主)](foundation_model_compression.md) - 包含稀疏量化与权重压缩、长序列压缩、权重压缩流程、低秩分解。 ## 三、训练加速与模型改造 - [训练加速与模型改造](pruning_and_distillation.md) - 包含重要性剪枝、Transformer 剪枝、Sparse tool、模型蒸馏。 - [稀疏加速训练](sparse_acceleration_training.md) - 包含宽度扩增与深度扩增模型的稀疏训练加速流程。 ## 四、工具与生态适配 - [辅助工具与专项指导](compression_utils.md) - 包含量化权重格式说明与 MindSpeed 适配器。 - [伪量化精度测试工具](fake_quantization_accuracy_testing_tool.md) - 包含 Precision Tool 使用方式与测试流程。 - [多模态生成模型推理优化](inference_optimization_for_multimodal_generative_model.md) - 包含 DiT 缓存优化与自适应采样优化流程。 - [常见代码示例](quantization_and_sparse_quantization_scenario_import_code_examples.md) - 包含常见量化/稀疏量化场景导入代码样例。 2.3 配置readthedocs文档托管: https://modelslim.readthedocs.io/zh-cn/latest/ 2.4 配置deepwiki: https://deepwiki.com/Keithwwa/ModelSlim 3. 验证: 3.1. gimini代码检视: https://github.com/Keithwwa/ModelSlim/pull/1 See merge request: Ascend/msmodelslim!109 | 5 个月前 | |
【msmodelslim】资料问题整改 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !18 merge docs into master 【msmodelslim】资料问题整改 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】资料问题整改 See merge request: Ascend/msmodelslim!18 | 7 个月前 | |
【msmodelslim】cleancode Co-authored-by: caishengcheng<caishengcheng@huawei.com> | 7 个月前 | |
【master】【docs】:版本发布,安装指南对应跳转版本说明同步 Co-authored-by: zzm30<zhengzhimin1@h-partners.com> # message auto-generated for no-merge-commit merge: !781 merge master into master 【master】【docs】:版本发布,安装指南对应跳转版本说明同步 Created-by: zzm30 Commit-by: zzm30 Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/development_guide/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) **修改目的:**(本 PR 要达成什么目标) **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 1. 版本发布,安装指南对应同步修改跳转26.1.0版本说明。 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [x] 是否具备 UT 测试用例看护 资料修改 - [ ] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!781 | 5 天前 | |
【master】【docs】:链接有效性修改;doctools检查问题修改 Co-authored-by: zzm30<zhengzhimin1@h-partners.com> # message auto-generated for no-merge-commit merge: !690 merge master into master 【master】【docs】:链接有效性修改;doctools检查问题修改 Created-by: zzm30 Commit-by: zzm30 Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](https://msmodelslim.readthedocs.io/zh-cn/latest/zh/development_guide/integrating_models) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) **修改目的:**(本 PR 要达成什么目标) **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 1. 链接有效性修改; 2. doctools检查问题修改。 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 - [x] 是否未采集或打印敏感信息 - [x] 是否已正确设置文件权限 - [x] 是否充分考虑浮点运算溢出、除零等异常场景 - [x] 是否已对正则表达式做 ReDos 检查 **DT** - [x] 是否具备 UT 测试用例看护 资料修改 - [ ] 是否需要添加冒烟:否 - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因) - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途) See merge request: Ascend/msmodelslim!690 | 30 天前 | |
[Feature] add full UT support: -e FULL_UT=true triggers all test cases Co-authored-by: tanxiangyuu<tanxiangyu2@huawei.com> # message auto-generated for no-merge-commit merge: !783 merge feat/full-ut into master [Feature] add full UT support: -e FULL_UT=true triggers all test cases Created-by: tanxiangyuu Commit-by: tanxiangyuu Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [贡献指南](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/knowledge_base/model/integrating_models.md) PR 标题前缀:[Feature] add full UT support via test -e full_ut=true ## 1. 影响面评估 **接口变更(按需):** 有 > 备注: build.py 新增 -e full_ut=true 选项,与 test 命令组合使用触发全量单元测试。原有 test 命令行为不变,-e 其余 KEY=VALUE 格式兼容。 > > 变更范围:build.py 的 test 分支增加 full_ut 判断,顶层增加 -e 解析逻辑,不涉及 CLI、API、YAML。 **输出件变更(按需):** 无 > 备注:全量 UT 模式下不产生构建产物;正常构建路径产物不变。 **非兼容变更(按需):** 无 > 备注:test 命令行为完全不变,仅新增选项,无迁移成本。 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 当前 python build.py test 仅执行 run_ut.sh --modelslim_v1(精简 UT 子集),在需要跑全量 UT case 时缺少统一的入口。 **修改目的:** 提供一键全量 UT 能力,安装全量依赖并运行全部测试用例(13 个模块 + smoke)。 **修改内容:** - build:新增 _prepare_all_dependencies() 方法,安装 requirements_all.txt 全量依赖 - build:新增 requirements_all.txt 文件,聚合运行时 + 测试框架 + 核心 ML + ONNX + 多模态等依赖 - build:顶层解析 -e 选项,test 命令下 full_ut=true 时安装全量依赖并执行全部测试用例 **概念域参考(填写提示):** - cli:命令行 quant / analyze / tune - app:最佳实践量化、量化分析、精度反馈自动调优等 - core:算法、量化服务、调度、张量量化、调优策略、最佳实践、上下文等 - infra:模型适配、调优计划/历史/缓存、测评服务等 - utils:日志、错误处理、插件等 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) **复现步骤(可选):** bash # 全量 UT(安装全量依赖 + 执行全部用例) python build.py test -e full_ut=true # 全量 UT(跳过依赖安装,仅执行用例) python build.py test local -e full_ut=true # 原有精简 UT 不受影响 python build.py test python build.py test local # 正常构建不受影响 python build.py python build.py -v 2.0.0 ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [ ] N/A 是否已校验外部数据 - [ ] N/A 是否未采集或打印敏感信息 - [ ] N/A 是否已正确设置文件权限 - [ ] N/A 是否充分考虑浮点运算溢出、除零等异常场景 - [ ] N/A 是否已对正则表达式做 ReDos 检查 **DT** - [ ] N/A 是否具备 UT 测试用例看护:N/A(构建脚本变更,非业务逻辑代码) - [ ] N/A 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!783 | 4 天前 | |
【msmodelslim】刷新文件头部声明和版权 Co-authored-by: caishengcheng<caishengcheng@huawei.com> # message auto-generated for no-merge-commit merge: !28 merge license into master 【msmodelslim】刷新文件头部声明和版权 Created-by: caishengcheng Commit-by: caishengcheng Merged-by: ascend-robot Description: 【msmodelslim】刷新文件头部声明和版权 See merge request: Ascend/msmodelslim!28 | 6 个月前 | |
[Doc] 重组中文资料目录并同步导航与链接 Co-authored-by: joejoezhou<zhourongchen1@huawei.com> # message auto-generated for no-merge-commit merge: !761 merge feature/docs-dirs into master [Doc] 重组中文资料目录并同步导航与链接 Created-by: joejoezhou Commit-by: joejoezhou Merged-by: ascend-robot Description: # PR 提交说明 提交前请阅读 [贡献指南](https://gitcode.com/Ascend/msmodelslim/blob/master/docs/zh/contributing/contributing_guide.md),开发者文档:[模型接入指南](../docs/zh/knowledge_base/model/integrating_models.md) PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致) ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** 中文资料目录层级混乱,流程与概念混杂,导航与相对链接随历史迁移积累了失效路径。 **修改目的:** 重组 docs/zh 目录结构,统一以流程指南/知识库/案例参考三类文档分层,并同步导航、索引与全库相关链接。 **修改内容:** - docs:新增推理加速知识库 knowledge_base,按 knowledge_base / user_guide / contributing / api_reference / best_practices / legal 重组中文资料 - docs:每个算法单独子目录、每个调优策略单独子目录、每个量化格式单独子目录 - docs:更新流程指南,区分业务流程和工具使用流程;算法总览补齐子算法 - docs:修复迁移后失效/过时链接,同步 mkdocs 导航(仅改路径,顶层序号与 master 一致) - docs:按评审意见修正相对路径、书名号外层、文档链接书名号与完整句句号 - docs:PR 模板中模型接入路径对齐新目录;清除 V0 案例残留 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [ ] 本地自验用例截图(请勿包含个人信息;可附复现命令) ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据(N/A) - [x] 是否未采集或打印敏感信息(N/A) - [x] 是否已正确设置文件权限(N/A) - [x] 是否充分考虑浮点运算溢出、除零等异常场景(N/A) - [x] 是否已对正则表达式做 ReDos 检查(N/A) **DT** - [x] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因):文档重组,无代码逻辑变更,不新增 UT - [x] 是否需要添加冒烟:否 See merge request: Ascend/msmodelslim!761 | 9 天前 | |
【msmodelslim】【UT】补充format存量代码UT,行覆盖率大于90 Co-authored-by: anreywmh<18845895998@163.com> # message auto-generated for no-merge-commit merge: !513 merge w_ut into master 【msmodelslim】【UT】补充format存量代码UT,行覆盖率大于90 Created-by: anreywmh Commit-by: anreywmh Merged-by: ascend-robot Description: 感谢您贡献的Pull Request! 在提交之前,请务必阅读 [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md)。 Thanks for sending a pull request! BEFORE SUBMITTING, PLEASE READ [CONTRIBUTING.md](https://gitcode.com/Ascend/msmodelslim/blob/master/CONTRIBUTING.md). ## PR描述 (What this PR does / why we need it?) - 请明确说明您提交PR的变更内容。本部分旨在概述所做的变更,以及此PR是如何解决该问题的。请尽可能地提供有助于评审人员更高效、更快速完成检视审查的实用说明。 补充format下的UT测试用例 :/home/wangminghua/msmodelslim/test# python3 -m coverage report \ --include="*/msmodelslim/format/*" \ --show-missing Name Stmts Miss Cover Missing ----------------------------------------------------------------------------------------------------------------------------------------------------------------- /home/wangminghua/msmodelslim/msmodelslim/format/__init__.py 19 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/ascendV1_format/__init__.py 2 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/ascendV1_format/ascendV1.py 12 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/ascendV1_format/ascendV1_json_writer_factory_infra.py 14 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/ascendV1_format/ascendV1_tensors_writer_factory_infra.py 15 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/base.py 49 2 96% 71, 76 /home/wangminghua/msmodelslim/msmodelslim/format/common/__init__.py 2 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/common/deqscale.py 11 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/common/pack.py 42 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/__init__.py 3 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/compressed_tensors.py 125 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/compressed_tensors_json_reader_factory_infra.py 12 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/compressed_tensors_json_writer_factory_infra.py 12 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/compressed_tensors_safetensors_writer_factory_infra.py 15 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/config/__init__.py 0 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/config/base.py 22 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/quantization/__init__.py 0 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/quantization/quant_args.py 171 9 95% 46, 184, 190, 203, 214, 222, 233, 263, 353 /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/quantization/quant_config.py 41 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/quantization/quant_config_builder.py 147 6 96% 99, 102, 118, 187, 235, 239 /home/wangminghua/msmodelslim/msmodelslim/format/compressed_tensors_format/quantization/quant_scheme.py 57 1 98% 96 /home/wangminghua/msmodelslim/msmodelslim/format/interface.py 21 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/mindie_format/__init__.py 2 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/mindie_format/mindie.py 12 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/mindie_format/mindie_json_writer_factory_infra.py 14 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/mindie_format/mindie_tensors_writer_factory_infra.py 15 0 100% /home/wangminghua/msmodelslim/msmodelslim/format/registry.py 39 0 100% ----------------------------------------------------------------------------------------------------------------------------------------------------------------- TOTAL 874 18 98% - 请说明为何需要这些更改,例如具体的使用场景或bug描述。 - 关联issue号(如果有)。 - Please clarify what changes you are proposing. The purpose of this section is to outline the changes and how this PR fixes the issue. If possible, please consider writing useful notes for better and faster reviews in your PR. - Please clarify why the changes are needed. For instance, the use case and bug description. - Related issue number (if any) ## 面向用户的变更 (Does this PR introduce _any_ user-facing change)? - 请注意,这里指的是**任何**面向用户的变更,包括但不限于API、用户界面或其他使用方式上的变更。 - Note that it means *any* user-facing change including all aspects such as API, interface or other behavior changes. ## 功能验证 (How was this patch tested?) 请确认CI已通过增量及存量的单元测试用例。 如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤(最好提供完整的可复现的操作路径及关键截图),以便Committer能够快速复现验证,也便于后续的维护。 如果未添加测试,请说明未添加的原因,以及为何难添加测试。 - [_] 功能自验  - [_] 本地自验截图(涉及个人标识符等敏感信息请注意脱敏) - [_] 新增/变更内容是否已新增/适配UT测试用例看护 CI passed with new added/existing test. If it was tested in a way different from regular unit tests, please clarify how you tested step by step, ideally copy and paste-able, so that other reviewers can test and check, and descendants can verify in the future. If tests were not added, please describe why they were not added and/or why it was difficult to add. - [_] Self-verification of the feature. - [_] Screenshot of local self-verification (please anonymize any sensitive information such as personal identifiers) - [_] Have new or modified unit test (UT) cases been added or adapted to cover the newly added or changed content? See merge request: Ascend/msmodelslim!513 | 1 个月前 | |
feat(dts): wave backend, scheduler and DP runner (2/2) Co-authored-by: rookie_hongchuan<hongchuan6@h-partners.com> # message auto-generated for no-merge-commit merge: !353 merge dts/infra-source-2 into master feat(dts): wave backend, scheduler and DP runner (2/2) Created-by: rookie_hongchuan Commit-by: rookie_hongchuan Merged-by: ascend-robot Description: ## 内容 - WaveDTSBackend、DistributedTaskScheduler、DPLayerWiseRunner 集成与 requirements.txt 更新。 ## 拆分说明 - 源码第 2 笔,相对 part 1 新增约 849 行。 - 分支 **基于 dts/infra-source-1**。建议在 **part 1 已合入 master** 后将本分支 **rebase 到最新 master** 再合并,避免与 part 1 重复变更。 - UT / 文档 MR 请在 **两笔源码均合入后** 再合并。 See merge request: Ascend/msmodelslim!353 | 3 个月前 | |
[Feature] 版本号修改为26.1.0 Co-authored-by: 李明宇<limingyu35@h-partners.com> # message auto-generated for no-merge-commit merge: !678 merge master-version-0701 into master [Feature] 版本号修改为26.1.0 Created-by: code_mingming Commit-by: 李明宇 Merged-by: ascend-robot Description: # PR 提交说明 ## 1. 影响面评估 **接口变更(按需):** 无 > 备注:若无变更请保留「无」;涉及 CLI、API、YAML 等请在此项补充说明。 **输出件变更(按需):** 无 > 备注:若无变更请保留「无」;涉及导出格式、产物路径等请在此项补充说明。 **非兼容变更(按需):** 无 > 备注:若无变更请保留「无」;若有非兼容变更请说明迁移方式。 **SIG 评审结论(按需):** 无 > 提醒:非兼容、安全风险等高危 PR 须经 SIG 评审后合入;无则保留「无」。 ## 2. 修改描述 **修改背景(可选):**(问题现象、使用场景等) **修改目的:**(本 PR 要达成什么目标) 版本号修改为26.1.0 **修改内容:**(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制) 版本号修改为26.1.0 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令)  **复现步骤(可选):** bash python3 setup.py bdist_wheel ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据 N/A - [x] 是否未采集或打印敏感信息 N/A - [x] 是否已正确设置文件权限 N/A - [x] 是否充分考虑浮点运算溢出、除零等异常场景 N/A - [x] 是否已对正则表达式做 ReDos 检查 N/A **DT** - [ ] 是否具备 UT 测试用例看护(路径:用例路径;未添加请说明原因)N/A - [ ] 是否需要添加冒烟:否(若「是」请说明冒烟场景及对应用途)N/A See merge request: Ascend/msmodelslim!678 | 1 个月前 |
MindStudio ModelSlim
✨ 最新消息
🔹 [2026.07.15]
- 新增对 Gemma4 Dense
gemma-4-31B-it(W8A8)、Gemma4 MoEgemma-4-26B-A4B-it(W8A8)模型的量化支持
🔹 [2026.07.07]
- 新增对腾讯混元
Hy3(W8A8)模型的量化支持
🔹 [2026.06.01]
- 新增对
InternVL3_5-38B(W8A8)、InternVL3_5-241B-A28B(W8A8)模型的量化支持 - 新增对
Kimi-K2.6(W4A8)模型的量化支持
🔹 [2026.04.01]
- 新增对
DeepSeek-V4-Flash(W8A8)模型的量化支持 - 新增对
Kimi-K2.5(W4A8)模型的量化支持
🔹 [2026.03.01]
- 新增对
GLM-4.6V(W8A8)模型的量化支持
🗂️ 历史更新(点击展开)
2026年2月
- msModelSlim 支持 Qwen3-Omni-30B-A3B-Thinking、Qwen3-Omni-30B-A3B-Instruct W8A8 量化
- msModelSlim 支持 Qwen2.5-Omni-7B W8A8 量化
- msModelSlim 支持 Qwen3.5-397B-A17B W8A8 量化
- msModelSlim 支持 GLM-5 W4A8 量化
- msModelSlim 优化一键量化场景推荐
2026年1月
- msModelSlim 支持 Qwen3-VL-32B-Instruct W8A8 量化
2025年12月
- msModelSlim 支持量化精度反馈自动调优,可根据精度需求自动搜索最优量化配置
- msModelSlim 支持自主量化多模态理解模型,支持多模态理解模型的量化接入
- msModelSlim 一键量化支持多卡量化,支持分布式逐层量化,提升大模型量化效率
- msModelSlim 支持 DeepSeek-V3.2 W8A8 量化,单卡 64GB 显存、100GB 内存即可执行
- msModelSlim 支持 DeepSeek-V3.2-Exp W4A8 量化,单卡 64GB 显存、100GB 内存即可执行
- msModelSlim 支持 Qwen3-VL-235B-A22B W8A8 量化
2025年11月
- msModelSlim 模型适配支持插件化和配置注册,支持依赖预检
2025年10月
- msModelSlim 支持 Qwen3-235B-A22B W4A8、Qwen3-30B-A3B W4A8 量化,vLLM-Ascend 已支持量化模型推理部署
2025年9月
- msModelSlim 支持 DeepSeek-V3.2-Exp W8A8 量化,单卡 64GB 显存、100GB 内存即可执行
- msModelSlim 现已解决Qwen3-235B-A22B在 W8A8 量化下频繁出现"游戏副本"等异常token的问题
- msModelSlim 支持 DeepSeek R1 W4A8 per-channel 量化【Prototype】
- msModelSlim 支持大模型量化敏感层分析
2025年8月
- msModelSlim 支持 Wan2.1 模型一键量化
- msModelSlim 支持大模型逐层量化,显著降低大模型量化内存占用
- msModelSlim 支持大模型 SSZ 权重量化算法,通过迭代搜索最优缩放因子和偏移量提升量化精度
ℹ️ 简介
MindStudio ModelSlim(msModelSlim) 是昇腾生态下的高性能模型压缩工具,支持稠密LLM、MoE及多模态模型的量化与压缩,开发者可通过 msModelSlim 工具快速调优并导出适配 MindIE、vLLM-Ascend 等框架的模型,在昇腾AI处理器上实现高效部署。
⚙️ 功能介绍
| 功能名称 | 功能描述 |
|---|---|
| 一键量化 | 集成主流大模型量化最佳实践,支持 W4A8、W8A8、W8A16 等多种量化类型,自动匹配最优配置,开箱即用。 |
| 自主量化 | 提供标准接入框架,支持开发者将自有 LLM 及多模态模型快速集成至一键量化流程。 |
| 敏感层分析 | 多维度评估各层量化敏感度,精准定位应回退或提位宽的层,为量化配置调优提供数据支撑。 |
| 自动调优 | 根据精度目标自动迭代搜索量化配置,量化与评估全流程自动化,无需人工反复调参。 |
| 权重转换 | 无需校准集,离线对已有量化权重做格式与精度变换(如 FP8→BF16、BF16→MXFP8)。 |
模型支持情况概览:各功能所适配的模型及其量化类型详见《模型支持矩阵》。
🚀 快速入门
帮助用户快速完成大模型量化功能,请参见《msModelSlim 快速入门》。
📦 安装指南
介绍工具的环境依赖与安装方法,请参见《msModelSlim 工具安装指南》。
📘 使用指南
工具的详细使用方法,请参见《msModelSlim 使用指南》。
📚 知识库
工具相关的术语和概念,请参见《推理加速知识库》。
💡 典型案例
通过典型问题场景帮助用户理解并掌握工具使用,请参见《msModelSlim 典型案例》。
❓ FAQ
常见问题及解决方案,请参见《FAQ》。
🌌 智能检索
为提升文档查阅效率,我们提供多种高效检索方式:
🔹 AI 问答(DeepWiki):自然语言问答,快速把握项目架构与模块关系。
🔹 精确搜索(ReadTheDocs):关键词全文检索,直达接口、参数与报错等信息。
🛠️ 贡献指南
具体请参见《贡献指南》。
⚖️ 相关说明
🔹 《版本说明》
🔹 《许可证声明》
🔹 《安全声明》
🔹 《免责声明》
🤝 建议与交流
欢迎大家为社区做贡献。如果有任何疑问或建议,请提交 Issues,我们会尽快回复。感谢您的支持。
| 即时互动(微信群) | 官方资讯(公众号) | 深度支持(助手/论坛) |
|---|---|---|
![]() 扫码加入技术交流群 |
![]() 扫码关注官方公众号 |
扫码入群并关注公众号,直达 MindStudio 用户与开发者最快捷的交流平台: 快速提问: 与社区小伙伴即时探讨技术问题 掌握动态: 第一时间获取版本发布与功能更新通知 经验共享: 与广大开发者交流最佳实践与实战心得 更多支持渠道:👉 昇腾助手: |
🙏 致谢
本工具由华为公司的下列部门联合贡献:
🔹 昇腾计算MindStudio开发部
🔹 昇腾计算生态使能部
🔹 昇腾计算技术开发部
🔹 2012实验室
感谢来自社区的每一个 PR,欢迎贡献!

