已合并
【docs】:文档链接有效性修改;语法格式低错修改 #892
zzm30创建于 5 天前
【docs】:文档链接有效性修改;语法格式低错修改 #892
已合并
zzm30创建于 5 天前
9 个文件变更+51-35
@@ -159,7 +159,7 @@ YAML 是「根配置 → spec → process[] / save[] → 嵌套对象」的树
159| 默认值 | Schema `default`;没有时回退 Field / `default_factory`(工厂值常不进 Schema) |159| 默认值 | Schema `default`;没有时回退 Field / `default_factory`(工厂值常不进 Schema) |
160| 取值范围或格式 | Schema `enum` / `const` / `minimum` / `maxLength` / `pattern` 等 |160| 取值范围或格式 | Schema `enum` / `const` / `minimum` / `maxLength` / `pattern` 等 |
161| 含义 | Schema `description`(即 `Field(description=)`);没有则为 `—` |161| 含义 | Schema `description`(即 `Field(description=)`);没有则为 `—` |
162-| 引用配置 | Schema `$ref` 对应的嵌套模型(展开进本页时写页内 HTML 锚点 `<a href="#anchor">`;独立页面写相对链接);type 分派字段统一指向基础类块锚点「本页 <a href="#anchor">§x.y</a>」 |162+| 引用配置 | Schema `$ref` 对应的嵌套模型(展开进本页时写页内 HTML 锚点 `<a href="#anchor">`;独立页面写相对链接);type 分派字段统一指向基础类块锚点`「本页 <a href="#anchor">§x.y</a>」` |
163 163 
164`AfterValidator` **不会**进入 JSON Schema。长度、区间必须写成 `Field(max_length=N)` / `ge` / `le`,或 `Literal` / `Enum`,才会出现在文档里。生成器不再解析校验闭包,也不维护函数名到中文的对照表。164`AfterValidator` **不会**进入 JSON Schema。长度、区间必须写成 `Field(max_length=N)` / `ge` / `le`,或 `Literal` / `Enum`,才会出现在文档里。生成器不再解析校验闭包,也不维护函数名到中文的对照表。
165 165 
@@ -182,7 +182,7 @@ YAML 是「根配置 → spec → process[] / save[] → 嵌套对象」的树
182 182 
183不再渲染「被引用的配置」小节(内部仍保留 `parents` 反查表供示例 YAML 上溯宿主)。展开嵌套时,BFS 从 `nested_refs` 出发,把可达的嵌套配置按引用处上下文路径渲染进「参数列表」内对应类名子块;task 页把 spec 一并展开。对未独立成页的 spec 的引用(如调优策略的 `template` 指向 `ModelslimV1ServiceConfig`)重定向到所属 task 页的 2.2 小节锚点(task 页块序固定:根块 §2.1,spec 为首个嵌套块 §2.2);跨目录链接按输出子目录计算相对路径。183不再渲染「被引用的配置」小节(内部仍保留 `parents` 反查表供示例 YAML 上溯宿主)。展开嵌套时,BFS 从 `nested_refs` 出发,把可达的嵌套配置按引用处上下文路径渲染进「参数列表」内对应类名子块;task 页把 spec 一并展开。对未独立成页的 spec 的引用(如调优策略的 `template` 指向 `ModelslimV1ServiceConfig`)重定向到所属 task 页的 2.2 小节锚点(task 页块序固定:根块 §2.1,spec 为首个嵌套块 §2.2);跨目录链接按输出子目录计算相对路径。
184 184 
185-**type 分派渲染**:同一字段路径下引用数 ≥2 或含 `type 分派` 即判为分派组。渲染成一个 `<h3 id="…">2.x 基础类名(按 type 分派)</h3>` 块:块内含基础类参数表(基础类本身是真实模型时)与「派生类」列表(每项 = 类名、`type` 值、一行说明、本页子块锚点或独立页相对链接),各派生类参数表 + 配置约束作为 `<h4 id="…">2.x 派生类名</h4>` 子块排在其后。同一页面同一基础类只渲染一次,后续分派字段的「引用配置」列别名指向该块锚点(例如 task 页的 `spec.process[]` 与 `spec.prior[].process` 共用同一个 `AutoProcessorConfig` 块)。「引用配置」列对分派字段统一写「本页 <a href="#anchor">§x.y</a>」指向基础类块锚点,不再逐个子类型平铺、也不再写「按 `type` 分派,见对应配置文档」汇总文案。配置块标题带可见编号,且标题与页内跳转统一用 HTML 标签(`<h3 id>` / `<h4 id>` / `<a href="#…">`),不用 Markdown 的 `{#anchor}` 属性语法。185+**type 分派渲染**:同一字段路径下引用数 ≥2 或含 `type 分派` 即判为分派组。渲染成一个 `<h3 id="…">2.x 基础类名(按 type 分派)</h3>` 块:块内含基础类参数表(基础类本身是真实模型时)与「派生类」列表(每项 = 类名、`type` 值、一行说明、本页子块锚点或独立页相对链接),各派生类参数表 + 配置约束作为 `<h4 id="…">2.x 派生类名</h4>` 子块排在其后。同一页面同一基础类只渲染一次,后续分派字段的「引用配置」列别名指向该块锚点(例如 task 页的 `spec.process[]` 与 `spec.prior[].process` 共用同一个 `AutoProcessorConfig` 块)。「引用配置」列对分派字段统一写`「本页 <a href="#anchor">§x.y</a>」`指向基础类块锚点,不再逐个子类型平铺、也不再写「按 `type` 分派,见对应配置文档」汇总文案。配置块标题带可见编号,且标题与页内跳转统一用 HTML 标签(`<h3 id>` / `<h4 id>` / `<a href="#…">`),不用 Markdown 的 `{#anchor}` 属性语法。
186 186 
187#### 4.3.6 示例 YAML187#### 4.3.6 示例 YAML
188 188 
@@ -7,6 +7,7 @@
7> 填写后须按[《量化术语百科校验清单》](01_term_glossary_checklist.md)逐项检查低错。7> 填写后须按[《量化术语百科校验清单》](01_term_glossary_checklist.md)逐项检查低错。
8>8>
9> **模板灵活性说明:** 模板章节分为「通用必填」「按需([OPTIONAL])」两类:9> **模板灵活性说明:** 模板章节分为「通用必填」「按需([OPTIONAL])」两类:
10+>
10> - 「通用必填」章节(概述、词条介绍)所有词条须保留;11> - 「通用必填」章节(概述、词条介绍)所有词条须保留;
11> - 「按需([OPTIONAL])」章节(关联流程、关联词条、参考文档)按需保留。12> - 「按需([OPTIONAL])」章节(关联流程、关联词条、参考文档)按需保留。
12>13>
@@ -21,6 +22,7 @@
21> **首次提出**:{{ first_proposed }}22> **首次提出**:{{ first_proposed }}
22>23>
23> **注释:** 上述内容为必填字段,用于快速定位词条的基本属性,各字段填写要求如下:24> **注释:** 上述内容为必填字段,用于快速定位词条的基本属性,各字段填写要求如下:
25+>
24> - 词条类别:取值须在模板允许的枚举集合内(量化基础概念 / 量化算法 / 离群值抑制算法 / 敏感层分析算法 / 自动调优策略 / 量化数据格式 / 量化参数 / 量化配置项 / 量化工具接口 / 量化评估指标 / 其他)。26> - 词条类别:取值须在模板允许的枚举集合内(量化基础概念 / 量化算法 / 离群值抑制算法 / 敏感层分析算法 / 自动调优策略 / 量化数据格式 / 量化参数 / 量化配置项 / 量化工具接口 / 量化评估指标 / 其他)。
25> - 英文名称:与文件名 `term_<english_name>.md` 中的 `english_name` 保持一致(大小写可不一致,拼写必须一致)。27> - 英文名称:与文件名 `term_<english_name>.md` 中的 `english_name` 保持一致(大小写可不一致,拼写必须一致)。
26> - 应用领域:简要说明词条适用的领域。28> - 应用领域:简要说明词条适用的领域。
@@ -32,9 +34,10 @@
32{{ overview }}34{{ overview }}
33 35 
34> **注释:** 概述要求:36> **注释:** 概述要求:
37+>
35> 1. 用一段话完成定义,字数控制在适度范围,精炼准确即可。38> 1. 用一段话完成定义,字数控制在适度范围,精炼准确即可。
36> 2. 应涵盖三个核心要素:是什么 / 解决什么问题 / 核心特征。39> 2. 应涵盖三个核心要素:是什么 / 解决什么问题 / 核心特征。
37-> 3. 行文中提及的、本身已存在或将来会存在的术语百科词条,应以超链接形式呈现:'[词条名](./term_xxx.md)'。词条链接锚文本用词条名、不加《书名号》(一级标题不含《);正文中单独提及文档标题时才按《[公共校验清单](00_common_checklist.md)》CE-05 加《书名号》。40+> 3. 行文中提及的、本身已存在或将来会存在的术语百科词条,应以超链接形式呈现:`[词条名](./term_xxx.md)`。词条链接锚文本用词条名、不加《书名号》(一级标题不含《);正文中单独提及文档标题时才按《[公共校验清单](00_common_checklist.md)》CE-05 加《书名号》。
38> 4. 避免展开算法细节或复述完整公式。41> 4. 避免展开算法细节或复述完整公式。
39> 5. 概述中提及的相关术语应尽量以超链接形式呈现,数量结合实际分析、越多越好(覆盖正文中所有已存在或将来会存在的术语词条),以利于知识图谱构建。42> 5. 概述中提及的相关术语应尽量以超链接形式呈现,数量结合实际分析、越多越好(覆盖正文中所有已存在或将来会存在的术语词条),以利于知识图谱构建。
40 43 
@@ -44,6 +47,7 @@
44 47 
45> **注释:** 简要介绍术语的背景、解决的问题与适用定位,可包含简要历史脉络。若有需要,不必将介绍的内容作为本节的子内容,可以自由增加章节,但新增章节以及后续章节编号需要得到正确调整。48> **注释:** 简要介绍术语的背景、解决的问题与适用定位,可包含简要历史脉络。若有需要,不必将介绍的内容作为本节的子内容,可以自由增加章节,但新增章节以及后续章节编号需要得到正确调整。
46> 编写建议:49> 编写建议:
50+>
47> - 可参考知识库中已有的同类词条写法,保持风格与粒度一致;51> - 可参考知识库中已有的同类词条写法,保持风格与粒度一致;
48> - 也可从第一性原理出发、站在用户视角介绍:该术语是什么、为什么值得了解、与已有概念的关系。52> - 也可从第一性原理出发、站在用户视角介绍:该术语是什么、为什么值得了解、与已有概念的关系。
49 53 
@@ -52,12 +56,14 @@
52{{ related_processes }}56{{ related_processes }}
53 57 
54> **注释:** 关联流程列表要求:58> **注释:** 关联流程列表要求:
59+>
55> 1. 列出与本术语相关的“流程指南”类文档(如《一键量化 V1》《敏感层分析使用指南》《自动调优使用指南》等)。60> 1. 列出与本术语相关的“流程指南”类文档(如《一键量化 V1》《敏感层分析使用指南》《自动调优使用指南》等)。
56> 2. 每项必须以超链接形式指向实际流程文档,禁止只写名称。61> 2. 每项必须以超链接形式指向实际流程文档,禁止只写名称。
57> 3. 简要说明流程与本术语的关系(如“使用本算法作为前置处理”“通过本流程可触发该术语对应的算法”)。62> 3. 简要说明流程与本术语的关系(如“使用本算法作为前置处理”“通过本流程可触发该术语对应的算法”)。
58> 4. 若无关联流程,可整体省略本章节。63> 4. 若无关联流程,可整体省略本章节。
59>64>
60> 示例:65> 示例:
66+>
61> - [《一键量化 V1》](../../../user_guide/usage_quick_quantization.md):默认集成本算法作为离群值抑制前置步骤。67> - [《一键量化 V1》](../../../user_guide/usage_quick_quantization.md):默认集成本算法作为离群值抑制前置步骤。
62> - [《敏感层分析使用指南》](../../../user_guide/usage_sensitive_layer_analysis.md):分析结果可用于回退使用本算法的层。68> - [《敏感层分析使用指南》](../../../user_guide/usage_sensitive_layer_analysis.md):分析结果可用于回退使用本算法的层。
63 69 
@@ -66,7 +72,8 @@
66{{ related_terms }}72{{ related_terms }}
67 73 
68> **注释:** 关联词条列表要求:74> **注释:** 关联词条列表要求:
69-> 1. 须使用超链接形式指向其他术语百科词条:[词条名](./term_xxx.md)。75+>
76+> 1. 须使用超链接形式指向其他术语百科词条:`[词条名](./term_xxx.md)`。
70> 2. 避免纯文本词条名(应确保可点击跳转)。77> 2. 避免纯文本词条名(应确保可点击跳转)。
71> 3. 关联词条的数量应结合实际分析、越多越好(关联词条越丰富,知识图谱连通性越强),在覆盖必要关联关系的基础上,尽量覆盖上位 / 下位 / 同类 / 对比 / 前置 / 后续 / 配套 / 应用对象 / 评估指标等各维度关系。78> 3. 关联词条的数量应结合实际分析、越多越好(关联词条越丰富,知识图谱连通性越强),在覆盖必要关联关系的基础上,尽量覆盖上位 / 下位 / 同类 / 对比 / 前置 / 后续 / 配套 / 应用对象 / 评估指标等各维度关系。
72> 4. 每个关联词条后建议用括号或冒号简要说明关系类型,关系类型包括但不限于:79> 4. 每个关联词条后建议用括号或冒号简要说明关系类型,关系类型包括但不限于:
@@ -79,10 +86,12 @@
79{{ references }}86{{ references }}
80 87 
81> **注释:** 参考文档要求:88> **注释:** 参考文档要求:
89+>
82> 1. 学术论文:标题、作者、会议/期刊、年份、链接(arXiv 或官方)。90> 1. 学术论文:标题、作者、会议/期刊、年份、链接(arXiv 或官方)。
83> 2. 工具内部文档:标题与相对路径链接。91> 2. 工具内部文档:标题与相对路径链接。
84> 3. 参考文档数量结合实际分析、越多越好:优先补充经典论文与权威规范的官方文档,尽可能覆盖原始出处、工具内实现与延伸阅读。92> 3. 参考文档数量结合实际分析、越多越好:优先补充经典论文与权威规范的官方文档,尽可能覆盖原始出处、工具内实现与延伸阅读。
85> 4. 多条以编号列表形式列出。93> 4. 多条以编号列表形式列出。
86>94>
87> 示例:95> 示例:
96+>
88> 1. Xiao G, et al. "SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models." arXiv preprint arXiv:2211.10438, 2022. https://arxiv.org/abs/2211.1043897> 1. Xiao G, et al. "SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models." arXiv preprint arXiv:2211.10438, 2022. https://arxiv.org/abs/2211.10438
@@ -2,7 +2,7 @@
2 2 
3> **注释:** 3> **注释:**
4> 将 `{{workflow_name}}` 换成具体流程名,例如“主流模型量化”“新模型接入量化”。名称应能让读者立刻知道要完成哪件事。 4> 将 `{{workflow_name}}` 换成具体流程名,例如“主流模型量化”“新模型接入量化”。名称应能让读者立刻知道要完成哪件事。
5-> 5+>
6> 必选章节只有三块:1.适用范围、2.输入和交付件、3.操作步骤。标题带 `[OPTIONAL]` 的章节按需保留;不需要就整节删除。6> 必选章节只有三块:1.适用范围、2.输入和交付件、3.操作步骤。标题带 `[OPTIONAL]` 的章节按需保留;不需要就整节删除。
7 7 
8## 1. 适用范围8## 1. 适用范围
@@ -23,6 +23,7 @@
23**后续操作**:{{follow_up_action}}23**后续操作**:{{follow_up_action}}
24 24 
25> **注释:** 25> **注释:**
26+>
26> - **上级流程**:本流程从哪个需求/流程接过来,例如“模型上线评审通过后”。 27> - **上级流程**:本流程从哪个需求/流程接过来,例如“模型上线评审通过后”。
27> - **前置条件**:动手前必须已具备的环境、材料或决策,写成可核对条目,例如“已安装兼容版本的 msModelSlim”“已拿到浮点权重与 tokenizer”。 28> - **前置条件**:动手前必须已具备的环境、材料或决策,写成可核对条目,例如“已安装兼容版本的 msModelSlim”“已拿到浮点权重与 tokenizer”。
28> - **后续操作**:本流程走完后进入什么,例如“进入发布与监控”或“精度不达标则进入调优”。29> - **后续操作**:本流程走完后进入什么,例如“进入发布与监控”或“精度不达标则进入调优”。
@@ -35,6 +36,7 @@
35| 交付件 | {{deliverable_name}} | {{deliverable_location}} | {{deliverable_constraint}} | {{deliverable_acceptance_method}} |36| 交付件 | {{deliverable_name}} | {{deliverable_location}} | {{deliverable_constraint}} | {{deliverable_acceptance_method}} |
36 37 
37> **注释:** 38> **注释:**
39+>
38> - **输入行**:流程开始前就要准备好的东西。名称要具体(如“浮点模型目录”),来源写从哪拿,约束写目录应含哪些文件或版本要求,验收方式写如何确认可用(如“可被目标 Transformers 版本加载”)。 40> - **输入行**:流程开始前就要准备好的东西。名称要具体(如“浮点模型目录”),来源写从哪拿,约束写目录应含哪些文件或版本要求,验收方式写如何确认可用(如“可被目标 Transformers 版本加载”)。
39> - **交付件行**:流程结束后必须交出的东西。名称要具体(如“量化权重目录”),保存位置写路径,约束写必须含哪些文件,验收方式写如何确认合格(如“含 quant_model_description.json 且推理冒烟通过”)。 41> - **交付件行**:流程结束后必须交出的东西。名称要具体(如“量化权重目录”),保存位置写路径,约束写必须含哪些文件,验收方式写如何确认合格(如“含 quant_model_description.json 且推理冒烟通过”)。
40> 42>
@@ -51,9 +53,7 @@ flowchart LR
51 53 
52> **注释:** 54> **注释:**
53> 在操作步骤前给出端到端阶段图,帮助读者先建立全局顺序。 55> 在操作步骤前给出端到端阶段图,帮助读者先建立全局顺序。
54->
55> 鼓励用 mermaid 或其他流程图:把 阶段A/阶段B/阶段C 换成真实阶段名,必要时在边上标注主要输入/输出。 56> 鼓励用 mermaid 或其他流程图:把 阶段A/阶段B/阶段C 换成真实阶段名,必要时在边上标注主要输入/输出。
56->
57> 图只做总览,不能替代下面的“操作步骤”。不要在 mermaid 代码里写 `{{placeholder}}`,花括号会被当成节点形状语法而报错。57> 图只做总览,不能替代下面的“操作步骤”。不要在 mermaid 代码里写 `{{placeholder}}`,花括号会被当成节点形状语法而报错。
58 58 
59## 5. 操作步骤59## 5. 操作步骤
@@ -62,7 +62,6 @@ flowchart LR
62 62 
63> **注释:** 63> **注释:**
64> 按真实执行顺序复制本节。步骤标题用“动词+对象”,例如“确认模型与量化方案”“执行一键量化”。 64> 按真实执行顺序复制本节。步骤标题用“动词+对象”,例如“确认模型与量化方案”“执行一键量化”。
65->
66> 每个步骤最少必须写“操作”和“输出”;其余字段按需保留。65> 每个步骤最少必须写“操作”和“输出”;其余字段按需保留。
67 66 
68**[OPTIONAL] 目标**:{{step_objective}} 67**[OPTIONAL] 目标**:{{step_objective}}
@@ -118,14 +117,13 @@ flowchart LR
118 117 
119> **注释:** 118> **注释:**
120> 整篇流程级别的异常处理约定,例如“精度不达标按调优指南排查后重跑量化与测评”“无法达标则发布浮点或更高精度回退版本”。 119> 整篇流程级别的异常处理约定,例如“精度不达标按调优指南排查后重跑量化与测评”“无法达标则发布浮点或更高精度回退版本”。
121->
122> 若各步骤“异常处置”已覆盖,可删除本章节以免重复。120> 若各步骤“异常处置”已覆盖,可删除本章节以免重复。
123 121 
124## 8. [OPTIONAL] 案例列表122## 8. [OPTIONAL] 案例列表
125 123 
126| 案例 | 简述 | 链接 |124| 案例 | 简述 | 链接 |
127| --- | --- | --- |125| --- | --- | --- |
128-| {{case_name}} | {{case_summary}} | 《[{{case_link_text}}]({{case_link}})》 |126+| {{case_name}} | {{case_summary}} | `《[{{case_link_text}}]({{case_link}})》`|
129 127 
130> **注释:** 128> **注释:**
131> 只做索引表:案例名、一句场景简述、可点击链接。详细步骤写在被链接的文档里,不要在本流程指南里展开长文。129> 只做索引表:案例名、一句场景简述、可点击链接。详细步骤写在被链接的文档里,不要在本流程指南里展开长文。
@@ -134,7 +132,7 @@ flowchart LR
134 132 
135| 术语 | 简述 | 链接 |133| 术语 | 简述 | 链接 |
136| --- | --- | --- |134| --- | --- | --- |
137-| {{term_name}} | {{term_summary}} | 《[{{term_link_text}}]({{term_link}})》 |135+| {{term_name}} | {{term_summary}} | `《[{{term_link_text}}]({{term_link}})》` |
138 136 
139> **注释:** 137> **注释:**
140> 只做索引表:术语名、一句白话简述、指向权威定义或支持矩阵/算法文档的链接。不要在本表写长定义。138> 只做索引表:术语名、一句白话简述、指向权威定义或支持矩阵/算法文档的链接。不要在本表写长定义。
@@ -143,7 +141,7 @@ flowchart LR
143 141 
144| 接口或能力 | 简述 | 链接 |142| 接口或能力 | 简述 | 链接 |
145| --- | --- | --- |143| --- | --- | --- |
146-| {{interface_name}} | {{interface_summary}} | 《[{{interface_link_text}}]({{interface_link}})》 |144+| {{interface_name}} | {{interface_summary}} | `《[{{interface_link_text}}]({{interface_link}})》` |
147 145 
148> **注释:** 146> **注释:**
149> 只做索引表:命令/API/配置协议名、一句用途简述、权威文档链接。参数细节写在被链接文档里。工具类流程建议保留本章节。147> 只做索引表:命令/API/配置协议名、一句用途简述、权威文档链接。参数细节写在被链接文档里。工具类流程建议保留本章节。
@@ -161,5 +159,4 @@ flowchart LR
161 159 
162> **注释:** 160> **注释:**
163> 写目标产品形态与资源边界,例如:在线推理服务 / 离线批处理;单机多卡 / 分布式;最低 NPU 型号与卡数;显存/内存下限;支持的 CANN、PyTorch、推理框架版本组合;Atlas 300I Duo 仅单卡等限制。 161> 写目标产品形态与资源边界,例如:在线推理服务 / 离线批处理;单机多卡 / 分布式;最低 NPU 型号与卡数;显存/内存下限;支持的 CANN、PyTorch、推理框架版本组合;Atlas 300I Duo 仅单卡等限制。
164->
165> 没有形态或资源约束差异时可删除本章节。162> 没有形态或资源约束差异时可删除本章节。
@@ -175,5 +175,5 @@ docs/zh/
175| 2026-08-05 | v1.0 | 首次发布。 |175| 2026-08-05 | v1.0 | 首次发布。 |
176| 2026-08-07 | v1.1 | 词条文档类型更名为「术语词条」,模板与校验清单文件更名 term_glossary;正文书名号与失效示例修正。 |176| 2026-08-07 | v1.1 | 词条文档类型更名为「术语词条」,模板与校验清单文件更名 term_glossary;正文书名号与失效示例修正。 |
177| 2026-08-12 | v1.2 | 书名号标题引用补链接(《流程指南模板》《术语词条模板》《公共校验清单》),与 CE-05/CW-02 对齐。 |177| 2026-08-12 | v1.2 | 书名号标题引用补链接(《流程指南模板》《术语词条模板》《公共校验清单》),与 CE-05/CW-02 对齐。 |
178-| 2026-08-12 | v1.3 | 书名号锚文本统一为《[标题](链接)》形式,CE-05 示例收敛为单一规范形式。 |178+| 2026-08-12 | v1.3 | 书名号锚文本统一为`《[标题](链接)》`形式,CE-05 示例收敛为单一规范形式。 |
179| 2026-08-19 | v1.4 | 量化配置文档模板与校验清单随生成器结构调整:参数列表按配置类分块、嵌套块输出类概述、移除独立“引用的配置/被引用的配置”章节、锚点统一为 HTML。 |179| 2026-08-19 | v1.4 | 量化配置文档模板与校验清单随生成器结构调整:参数列表按配置类分块、嵌套块输出类概述、移除独立“引用的配置/被引用的配置”章节、锚点统一为 HTML。 |
@@ -646,7 +646,7 @@ class Qwen3VLMoeModelAdapter(VlmBaseModelAdapter,
646 return adapter_config646 return adapter_config
647```647```
648 648 
649-详见:[Iterative Smooth 适配](../quantization_algorithms/iterative_smooth/term_iterative_smooth.md#4-模型适配接口)649+详见:[Iterative Smooth 算法词条](../quantization_algorithms/iterative_smooth/term_iterative_smooth.md)
650 650 
651#### 支持QuaRot旋转离群值抑制算法651#### 支持QuaRot旋转离群值抑制算法
652 652 
@@ -681,7 +681,7 @@ class Qwen3VLMoeModelAdapter(VlmBaseModelAdapter,
681 pass681 pass
682```682```
683 683 
684-详见:[QuaRot 适配](../quantization_algorithms/quarot/term_quarot.md#4-模型适配接口)684+详见:[QuaRot 算法词条](../quantization_algorithms/quarot/term_quarot.md)
685 685 
686### 参考资料686### 参考资料
687 687 
@@ -34,8 +34,8 @@ AscendV1 本质上是一套**昇腾推理侧的量化模型落盘约定**:它
34- 可选导出 QuaRot 旋转矩阵。34- 可选导出 QuaRot 旋转矩阵。
35- 通过描述文件中的枚举值表达对多种量化模式的承载能力。35- 通过描述文件中的枚举值表达对多种量化模式的承载能力。
36 36 
37- 
38### 2.2 <span id="export-artifacts">导出产物(交付件)</span>37### 2.2 <span id="export-artifacts">导出产物(交付件)</span>
38+ 
39#### 目录与文件说明39#### 目录与文件说明
40 40 
41执行一键量化(`ascendv1_saver`)后,在指定的 `save_path` 目录下典型生成以下文件:41执行一键量化(`ascendv1_saver`)后,在指定的 `save_path` 目录下典型生成以下文件:
@@ -65,7 +65,7 @@ AscendV1 本质上是一套**昇腾推理侧的量化模型落盘约定**:它
65| `{model_type}_best_practice.yaml` | **量化配置协议文件**,记录本次量化所使用的完整配置信息,参考《[量化配置协议详解](../../../user_guide/usage_quick_quantization.md#5-量化配置协议详解)》 |65| `{model_type}_best_practice.yaml` | **量化配置协议文件**,记录本次量化所使用的完整配置信息,参考《[量化配置协议详解](../../../user_guide/usage_quick_quantization.md#5-量化配置协议详解)》 |
66| `vocab.json` | 原始词汇映射文件,部分模型(如 GPT 风格模型)会包含此文件 |66| `vocab.json` | 原始词汇映射文件,部分模型(如 GPT 风格模型)会包含此文件 |
67| `optional/quarot.safetensors` | **可选导出**:QuaRot 全局旋转矩阵(仅在使用 QuaRot 且 `export_extra_info: true` 时生成),见下文可选导出 |67| `optional/quarot.safetensors` | **可选导出**:QuaRot 全局旋转矩阵(仅在使用 QuaRot 且 `export_extra_info: true` 时生成),见下文可选导出 |
68-`quant_model_description.json` 中,每个张量键对应一个量化类型标识;同一 Linear 层的所有参数(weight、scale 等)共享相同的类型标识。68+|`quant_model_description.json` | 每个张量键对应一个量化类型标识;同一 Linear 层的所有参数(weight、scale 等)共享相同的类型标识。|
69 69 
70#### quant_model_description.json70#### quant_model_description.json
71 71 
@@ -105,6 +105,7 @@ AscendV1 本质上是一套**昇腾推理侧的量化模型落盘约定**:它
105其余键值对为 `{张量名}: {量化类型}`,例如 `"model.layers.0.self_attn.q_proj.weight": "W8A8"`105其余键值对为 `{张量名}: {量化类型}`,例如 `"model.layers.0.self_attn.q_proj.weight": "W8A8"`
106 106 
107#### <span id="optional-quarot">可选导出:QuaRot 相关文件</span>107#### <span id="optional-quarot">可选导出:QuaRot 相关文件</span>
108+ 
108当流水线启用 QuaRot 且配置 `export_extra_info: true` 时,AscendV1 可额外写出旋转矩阵文件,并在描述文件中登记路径。算法本身见对应算法词条;此处仅说明**格式侧**落盘约定。109当流水线启用 QuaRot 且配置 `export_extra_info: true` 时,AscendV1 可额外写出旋转矩阵文件,并在描述文件中登记路径。算法本身见对应算法词条;此处仅说明**格式侧**落盘约定。
109 110 
110```bash111```bash
@@ -225,6 +226,7 @@ AscendV1 **均可落盘**下表中的格式枚举;下表描述的是产物能
225#### W8A8226#### W8A8
226 227 
227##### <span id="desc-w8a8">quant_model_description.json</span>228##### <span id="desc-w8a8">quant_model_description.json</span>
229+ 
228同一 Linear 下下列键共享类型 `"W8A8"``bias` 若保留浮点则可标 `"FLOAT"`):230同一 Linear 下下列键共享类型 `"W8A8"``bias` 若保留浮点则可标 `"FLOAT"`):
229 231 
230| 描述键 | 取值 | 说明 |232| 描述键 | 取值 | 说明 |
@@ -287,6 +289,7 @@ AscendV1 **均可落盘**下表中的格式枚举;下表描述的是产物能
287| `{prefix}.bias` | `"FLOAT"``"W8A8_MIX"` | 偏置(可选) |289| `{prefix}.bias` | `"FLOAT"``"W8A8_MIX"` | 偏置(可选) |
288 290 
289##### <span id="st-w8a8-mix">quant_model_weights*.safetensors</span>291##### <span id="st-w8a8-mix">quant_model_weights*.safetensors</span>
292+ 
290W8A8 静态激活相关字段与 W8A8_DYNAMIC 权重量化字段的并集:293W8A8 静态激活相关字段与 W8A8_DYNAMIC 权重量化字段的并集:
291 294 
292| 张量名 | 数据类型 | 说明 |295| 张量名 | 数据类型 | 说明 |
@@ -387,6 +390,7 @@ W8A8 静态激活相关字段与 W8A8_DYNAMIC 权重量化字段的并集:
387#### W8A8_MXFP8 / W4A8_MXFP / W4A4_MXFP4390#### W8A8_MXFP8 / W4A8_MXFP / W4A4_MXFP4
388 391 
389##### <span id="desc-mxfp">quant_model_description.json</span>392##### <span id="desc-mxfp">quant_model_description.json</span>
393+ 
390描述键取值分别为 `"W8A8_MXFP8"` / `"W4A8_MXFP"` / `"W4A4_MXFP4"`(与具体枚举一致):394描述键取值分别为 `"W8A8_MXFP8"` / `"W4A8_MXFP"` / `"W4A4_MXFP4"`(与具体枚举一致):
391 395 
392| 描述键 | 取值 | 说明 |396| 描述键 | 取值 | 说明 |
@@ -406,6 +410,7 @@ W8A8 静态激活相关字段与 W8A8_DYNAMIC 权重量化字段的并集:
406#### W4A4_MXFP4_DUALSCALE410#### W4A4_MXFP4_DUALSCALE
407 411 
408##### <span id="desc-mxfp-dualscale">quant_model_description.json</span>412##### <span id="desc-mxfp-dualscale">quant_model_description.json</span>
413+ 
409在 [MXFP 描述字段](#desc-mxfp)基础上,取值均为 `"W4A4_MXFP4_DUALSCALE"`,并增加:414在 [MXFP 描述字段](#desc-mxfp)基础上,取值均为 `"W4A4_MXFP4_DUALSCALE"`,并增加:
410 415 
411| 描述键 | 取值 | 说明 |416| 描述键 | 取值 | 说明 |
@@ -413,6 +418,7 @@ W8A8 静态激活相关字段与 W8A8_DYNAMIC 权重量化字段的并集:
413| `{prefix}.weight_dual_scale` | `"W4A4_MXFP4_DUALSCALE"` | 第二路 scale |418| `{prefix}.weight_dual_scale` | `"W4A4_MXFP4_DUALSCALE"` | 第二路 scale |
414 419 
415##### <span id="st-mxfp-dualscale">quant_model_weights*.safetensors</span>420##### <span id="st-mxfp-dualscale">quant_model_weights*.safetensors</span>
421+ 
416在 [MXFP 权重字段](#st-mxfp)基础上额外包含:422在 [MXFP 权重字段](#st-mxfp)基础上额外包含:
417 423 
418| 张量名 | 数据类型 | 说明 |424| 张量名 | 数据类型 | 说明 |
@@ -32,6 +32,7 @@ compressed-tensors 本质上是一套**面向 HuggingFace / vLLM 生态的量化
32- 仅部分 QIR preset 实现了导出 handler(见下文支持表)。32- 仅部分 QIR preset 实现了导出 handler(见下文支持表)。
33 33 
34### 2.2 <span id="export-artifacts">导出产物(交付件)</span>34### 2.2 <span id="export-artifacts">导出产物(交付件)</span>
35+ 
35#### 目录与文件说明36#### 目录与文件说明
36 37 
37执行一键量化(`compressed_tensors`)后,在指定的 `save_path` 目录下典型生成以下文件:38执行一键量化(`compressed_tensors`)后,在指定的 `save_path` 目录下典型生成以下文件:
@@ -154,6 +155,7 @@ compressed-tensors **均可导出**下表中的 Preset;下表描述的是产
154#### W8A8 Static155#### W8A8 Static
155 156 
156##### <span id="desc-w8a8-static">config.json → quantization_config</span>157##### <span id="desc-w8a8-static">config.json → quantization_config</span>
158+ 
157典型 `config_groups` 条目(`weights.dynamic = false`,含静态激活):159典型 `config_groups` 条目(`weights.dynamic = false`,含静态激活):
158 160 
159| 字段路径 | 典型取值 | 说明 |161| 字段路径 | 典型取值 | 说明 |
@@ -176,6 +178,7 @@ compressed-tensors **均可导出**下表中的 Preset;下表描述的是产
176#### W8A8 Dynamic178#### W8A8 Dynamic
177 179 
178##### <span id="desc-w8a8-dynamic">config.json → quantization_config</span>180##### <span id="desc-w8a8-dynamic">config.json → quantization_config</span>
181+ 
179典型 `config_groups` 条目(激活为动态,导出时 `input_activations.dynamic = true` 或按 QIR 约定写入):182典型 `config_groups` 条目(激活为动态,导出时 `input_activations.dynamic = true` 或按 QIR 约定写入):
180 183 
181| 字段路径 | 典型取值 | 说明 |184| 字段路径 | 典型取值 | 说明 |
@@ -339,23 +339,23 @@ modelslim_v1是量化工具推出的新一代量化处理框架,目前正在
339 339 
340##### 5.2.4.1 支持处理器表340##### 5.2.4.1 支持处理器表
341 341 
342-| 处理器 | 处理器类型 | 配置示例 | 配置字段详解 |342+| 处理器 | 处理器类型 | 使用指南 |
343-| :--- | :--- | :--- | :--- |343+| :--- | :--- | :--- |
344-| SmoothQuant | 离群值抑制 | [SmoothQuant 配置示例](../knowledge_base/quantization_algorithms/smooth_quant/usage_smooth_quant.md#步骤-1编写-yaml-配置文件) | [配置字段详解](../knowledge_base/quantization_algorithms/smooth_quant/usage_smooth_quant.md#步骤-1编写-yaml-配置文件) |344+| SmoothQuant | 离群值抑制 | [SmoothQuant 使用指南](../knowledge_base/quantization_algorithms/smooth_quant/usage_smooth_quant.md) |
345-| Iterative Smooth | 离群值抑制 | [Iterative Smooth 配置示例](../knowledge_base/quantization_algorithms/iterative_smooth/usage_iterative_smooth.md#步骤-1编写-yaml-配置文件) | [配置字段详解](../knowledge_base/quantization_algorithms/iterative_smooth/usage_iterative_smooth.md#步骤-1编写-yaml-配置文件) |345+| Iterative Smooth | 离群值抑制 | [Iterative Smooth 使用指南](../knowledge_base/quantization_algorithms/iterative_smooth/usage_iterative_smooth.md) |
346-| Flex Smooth Quant | 离群值抑制 | [Flex Smooth Quant 配置示例](../knowledge_base/quantization_algorithms/flex_smooth_quant/usage_flex_smooth_quant.md#步骤-1编写-yaml-配置文件) | [配置字段详解](../knowledge_base/quantization_algorithms/flex_smooth_quant/usage_flex_smooth_quant.md#步骤-1编写-yaml-配置文件) |346+| Flex Smooth Quant | 离群值抑制 | [Flex Smooth Quant 使用指南](../knowledge_base/quantization_algorithms/flex_smooth_quant/usage_flex_smooth_quant.md) |
347-| Flex AWQ SSZ | 离群值抑制 | [Flex AWQ SSZ 配置示例](../knowledge_base/quantization_algorithms/flex_awq_ssz/usage_flex_awq_ssz.md#步骤-1编写-yaml-配置文件) | [配置字段详解](../knowledge_base/quantization_algorithms/flex_awq_ssz/usage_flex_awq_ssz.md#步骤-1编写-yaml-配置文件) |347+| Flex AWQ SSZ | 离群值抑制 | [Flex AWQ SSZ 使用指南](../knowledge_base/quantization_algorithms/flex_awq_ssz/usage_flex_awq_ssz.md) |
348-| AWQ | 离群值抑制 | [AWQ 配置示例](../knowledge_base/quantization_algorithms/awq_smooth/usage_awq_smooth.md#步骤-1编写-yaml-配置文件) | [配置字段详解](../knowledge_base/quantization_algorithms/awq_smooth/usage_awq_smooth.md#步骤-1编写-yaml-配置文件) |348+| AWQ | 离群值抑制 | [AWQ 使用指南](../knowledge_base/quantization_algorithms/awq_smooth/usage_awq_smooth.md) |
349-| KV Smooth | 离群值抑制 | [KV Smooth 配置示例](../knowledge_base/quantization_algorithms/kv_smooth/usage_kv_smooth.md#步骤-1编写-yaml-配置文件) | [KV Smooth 配置字段详解](../knowledge_base/quantization_algorithms/kv_smooth/usage_kv_smooth.md#步骤-1编写-yaml-配置文件) |349+| KV Smooth | 离群值抑制 | [KV Smooth 使用指南](../knowledge_base/quantization_algorithms/kv_smooth/usage_kv_smooth.md) |
350-| QuaRot | 离群值抑制 | [QuaRot 配置示例](../knowledge_base/quantization_algorithms/quarot/usage_quarot.md#步骤-1编写-yaml-配置文件) | [QuaRot 配置字段详解](../knowledge_base/quantization_algorithms/quarot/usage_quarot.md#步骤-1编写-yaml-配置文件) |350+| QuaRot | 离群值抑制 | [QuaRot 使用指南](../knowledge_base/quantization_algorithms/quarot/usage_quarot.md) |
351-| Adapt Rotation | 离群值抑制 | [Adapt Rotation 配置示例](../knowledge_base/quantization_algorithms/adapt_rotation/usage_adapt_rotation.md#步骤-1确认适配器实现分析接口) | [配置字段详解](../knowledge_base/quantization_algorithms/adapt_rotation/usage_adapt_rotation.md#步骤-1确认适配器实现分析接口) |351+| Adapt Rotation | 离群值抑制 | [Adapt Rotation 使用指南](../knowledge_base/quantization_algorithms/adapt_rotation/usage_adapt_rotation.md) |
352-| linear_quant | 量化 | [线性量化配置示例](../knowledge_base/quantization_algorithms/linear_quant/usage_linear_quant.md#步骤-1编写-yaml-配置文件) | [线性量化配置字段详解](../knowledge_base/quantization_algorithms/linear_quant/usage_linear_quant.md#步骤-1编写-yaml-配置文件) |352+| linear_quant | 量化 | [线性量化使用指南](../knowledge_base/quantization_algorithms/linear_quant/usage_linear_quant.md) |
353-| group | 量化 | [group 配置示例](../api_reference/config/processor_group.md#42-yaml配置示例) | [group 配置字段详解](../api_reference/config/processor_group.md#43-yaml配置字段详解) |353+| group | 量化 | [group 使用指南](../api_reference/config/processor_group.md) |
354-| KVCache Quant | 量化 | [KVCache Quant 配置示例](../knowledge_base/quantization_algorithms/kvcache_quant/usage_kvcache_quant.md#步骤-1编写-yaml-配置文件) | [KVCache Quant 配置字段详解](../knowledge_base/quantization_algorithms/kvcache_quant/usage_kvcache_quant.md#步骤-1编写-yaml-配置文件) |354+| KVCache Quant | 量化 | [KVCache Quant 使用指南](../knowledge_base/quantization_algorithms/kvcache_quant/usage_kvcache_quant.md) |
355-| FA3 Quant | 量化 | [FA3 Quant 配置示例](../knowledge_base/quantization_algorithms/fa3_quant/usage_fa3_quant.md#步骤-1编写-yaml-配置文件) | [FA3 Quant 配置字段详解](../knowledge_base/quantization_algorithms/fa3_quant/usage_fa3_quant.md#步骤-1编写-yaml-配置文件) |355+| FA3 Quant | 量化 | [FA3 Quant 使用指南](../knowledge_base/quantization_algorithms/fa3_quant/usage_fa3_quant.md) |
356-| Float Sparse | 量化 | [Float Sparse 配置示例](../knowledge_base/quantization_algorithms/float_sparse/usage_float_sparse.md#步骤-1修改模型并编写-yaml-配置文件) | [Float Sparse 配置字段详解](../knowledge_base/quantization_algorithms/float_sparse/usage_float_sparse.md#步骤-1修改模型并编写-yaml-配置文件) |356+| Float Sparse | 量化 | [Float Sparse 使用指南](../knowledge_base/quantization_algorithms/float_sparse/usage_float_sparse.md) |
357-| AutoRound | 量化 | [AutoRound 配置示例](../knowledge_base/quantization_algorithms/autoround/usage_autoround.md#步骤-1编写-yaml-配置文件) | [AutoRound 配置字段详解](../knowledge_base/quantization_algorithms/autoround/usage_autoround.md#步骤-1编写-yaml-配置文件) |357+| AutoRound | 量化 | [AutoRound 使用指南](../knowledge_base/quantization_algorithms/autoround/usage_autoround.md) |
358-| SVDQuant (W4A4方案) | 综合方案 | [SVDQuant 配置示例](../knowledge_base/quantization_algorithms/svdquant/usage_svdquant.md#步骤-1编写-yaml-配置文件) | [SVDQuant 配置字段详解](../knowledge_base/quantization_algorithms/svdquant/usage_svdquant.md#步骤-1编写-yaml-配置文件) |358+| SVDQuant (W4A4方案) | 综合方案 | [SVDQuant 使用指南](../knowledge_base/quantization_algorithms/svdquant/usage_svdquant.md) |
359 359 
360#### 5.2.5 save - 保存器配置字段360#### 5.2.5 save - 保存器配置字段
361 361 
@@ -187,6 +187,7 @@ msmodelslim analyze attn_head \
187 "copying": {0: [3], 12: [2]},187 "copying": {0: [3], 12: [2]},
188 }188 }
189 ```189 ```
190+
190 - `prefix_matching` 的 key 为 layer 索引(int),value 为该层被选中的 KV head 索引列表。191 - `prefix_matching` 的 key 为 layer 索引(int),value 为该层被选中的 KV head 索引列表。
191 - `copying` 的 key 为 layer 索引(int),value 为该层被选中的 KV head 索引列表。192 - `copying` 的 key 为 layer 索引(int),value 为该层被选中的 KV head 索引列表。
192 193