| [Feature] add mimo-v2-flash-w8a8 quant adapter Co-authored-by: Kingbo_998<jingbo_gao@163.com> # message auto-generated for no-merge-commit merge: !384 merge master into master [Feature] add mimo-v2-flash-w8a8 quant adapter Created-by: Kingbo_998 Commit-by: Kingbo_998 Merged-by: ascend-robot Description: ## 1. 影响面评估 **接口变更(按需):** 无 **输出件变更(按需):** 无 **非兼容变更(按需):** 无 **SIG 评审结论(按需):** 无 ## 2. 修改描述 **修改背景(可选):** msModelSlim 当前缺少 MiMo-V2-Flash 模型的量化适配。 **修改目的:** 新增 MiMo-V2-Flash 模型适配器及 W8A8 量化配置,使该模型能够接入 msModelSlim 量化流程,并在降低模型加载内存占用的情况下完成量化。 **修改内容:** - infra/模型适配:新增 mimo_v2_flash 模型适配器,实现模型初始化、数据处理、逐层加载、模型遍历和前向流程。 - infra/模型注册:在 config/config.ini 中注册 MiMo-V2-Flash 模型名称、适配器加载入口及 transformers==4.57.6 依赖。 - infra/逐层加载:根据权重索引按需加载 Decoder Layer,支持 MiMo-V2-Flash 的 Hybrid Attention 和 MoE/MLP 混合层结构。 - app/最佳实践量化:新增 lab_practice/mimo_v2/mimo-v2-flash-w8a8.yaml,提供 per-token 激活量化和 per-channel 权重量化的 W8A8 配置。 - utils/安全校验:模型路径和权重索引分别通过 get_valid_read_path、json_safe_load 进行读取与校验。 ## 3. 功能验证 冒烟由 CI 门禁检查,无需填写“冒烟是否通过”。 - [x] 功能自验 - [x] 本地自验用例截图(请勿包含个人信息;可附复现命令) msmodelslim quant --device npu --model_path ./MiMo-V2-Flash-BF16/ --save_path ./MiMo-V2-Flash-w8a8/ --model_type MiMo-V2-Flash --config_path ./config.yaml --trust_remote_code True **验证结果:** - MiMo-V2-Flash 模型能够正常识别并加载对应适配器。 - W8A8 量化流程可以正常执行并导出量化模型。 - 量化模型精度已完成自验,与 BF16 基线精度对齐。 - 逐层加载流程运行正常,可以按需加载 Decoder Layer。 **验证配置:** text lab_practice/mimo_v2/mimo-v2-flash-w8a8.yaml ## 4. 自检(请逐项确认,不适用标 N/A) **典型安全编码问题** - [x] 是否已校验外部数据:模型路径和权重索引使用项目安全接口进行校验和读取。 - [x] 是否未采集或打印敏感信息:未采集或打印用户敏感信息。 - [ ] N/A:是否已正确设置文件权限。本次修改未新增文件写入和权限设置逻辑。 - [ ] N/A:是否充分考虑浮点运算溢出、除零等异常场景。本次修改未新增相关数值计算逻辑。 - [ ] N/A:是否已对正则表达式做 ReDoS 检查。本次修改未使用正则表达式。 **DT** - [ ] N/A:是否具备 UT 测试用例看护。本次未新增 UT;适配验证依赖完整 MiMo-V2-Flash 权重及 NPU 量化环境,已通过真实模型量化、精度对比和 CI 门禁进行验证。 - [x] 是否需要添加冒烟:否,现有 CI 门禁及模型量化自验已覆盖本次适配的主要流程。 See merge request: Ascend/msmodelslim!384 | 6 天前 |