已合并
[Feature] Add Qwen3.6-27B-w8a8 quantization config #748
A_J_F创建于 25 天前
[Feature] Add Qwen3.6-27B-w8a8 quantization config #748
已合并
Pull Request已成功合入, 合并人@ascend-robot
(感谢 A_J_F 的贡献)atomgit-bot
25 天前 评论:
25 天前 评论:
变更摘要
本次 PR 新增了 Qwen3.6-27B 模型的 w8a8 量化配置文件 lab_practice/qwen3_5_moe/qwen3_6_27B_w8a8.yaml,在现有 Qwen3.6-Dense-w8a8 量化方案的基础上,扩展了对 qkv 和 z 投影层的量化支持,以提升 Qwen3.6-27B 在 w8a8 量化下的推理性能。
主要改动
- 新增量化配置文件:创建
lab_practice/qwen3_5_moe/qwen3_6_27B_w8a8.yaml,配置 ID 为qwen3_6_27B_w8a8,采用 per-token 激活量化和 per-channel 权重量化的 int8 对称量化策略。 - 扩展量化覆盖范围:在
include列表中新增*linear_attn.in_proj_qkv*和*linear_attn.in_proj_z*两个匹配规则,使 QKV 投影层和 Z 投影层纳入量化范围。 - 排除特定层:通过
exclude配置排除*linear_fc2*,避免对该层进行量化,沿用与 Dense 方案一致的排除策略。 - 输出与数据集配置:使用
ascendv1_saver保存量化结果(part_file_size: 4),并指定校准数据集为calibImages。


AtlasAccount
25 天前 评论:
25 天前 评论:
atomgit-bot
25 天前 评论:
25 天前 评论:
25 天前 添加了label:ascend-cla/yes
ascend-robot
25 天前 评论:
25 天前 评论:
此处折叠了68条消息 查看更多
24 天前 添加了label:approvedlgtm
ascend-robot
24 天前 评论:
24 天前 评论:
The MR can not be merged, because of CodeReview discussion not resolved
If you want to solve this problem, you can click here to do it in the FAQs.


24 天前 解决了最后一个问题
24 天前 合入了pull request
ascend-robot
24 天前 评论:
24 天前 评论:
Pull Request 已合并或已关闭。
If you want to solve this problem, you can click here to do it in the FAQs.


PR 提交说明
提交前请阅读 CONTRIBUTING.md,开发者文档:模型接入指南
PR 标题前缀:[Feature]、[Bugfix]、[Doc]、[Test](与 CONTRIBUTING 一致)
1. 影响面评估
接口变更(按需): 无
输出件变更(按需): 无
非兼容变更(按需): 无
SIG 评审结论(按需): 无
2. 修改描述
修改背景(可选):
现有Qwen3.6-Dense-w8a8的量化配置中没有对qkvz量化
修改目的:
新增Qwen3.6-27B-w8a8的量化配置,提升Qwen3.6-27B-w8a8性能
修改内容:(按「概念 - 变化」分条,示例:core/算法:新增 SmoothQuant 离群值抑制)
新增Qwen3.6-27B-w8a8的量化配置,在Qwen3.6-Dense-w8a8量化的基础上,增加了对qkvz的量化。
概念域参考(填写提示):
3. 功能验证
冒烟由 CI 门禁检查,无需填写「冒烟是否通过」。
复现步骤(可选):
msmodelslim quant --model_path ${MODEL_PATH} --save_path ${SAVE_PATH} --device npu --model_type Qwen3.6-27B --quant_type w8a8 --trust_remote_code True4. 自检(请逐项确认,不适用标 N/A)
典型安全编码问题
DT