已合并
x1 x2 int8输入,scale为float32和bfloat32场景,且为perchannel和pertoken场景支持大于65535,修复资料 #6978
wmg1创建于 7月3日
x1 x2 int8输入,scale为float32和bfloat32场景,且为perchannel和pertoken场景支持大于65535,修复资料 #6978
已合并
共 2 个文件变更+4-4
| @@ -302,8 +302,8 @@ aclnnStatus aclnnQuantMatmulV4( | |||
| 302 | - out数据类型支持FLOAT16、INT8,当pertokenScaleOptional不为空tensor时,out数据类型只支持FLOAT16。 | 302 | - out数据类型支持FLOAT16、INT8,当pertokenScaleOptional不为空tensor时,out数据类型只支持FLOAT16。 |
| 303 | 303 | ||
| 304 | - <term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term>、<term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term>: | 304 | - <term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term>、<term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term>: |
| 305 | - - x1的最后一维大小不能超过65535,x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。 | 305 | + - x1的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,scale的dtype为FLOAT32或BFLOAT16且scale和pertokenScaleOptional维度都为1时,支持大于65535。x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。 |
| 306 | - - x2的最后一维大小不能超过65535,x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。 | 306 | + - x2的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,scale的dtype为FLOAT32或BFLOAT16且scale和pertokenScaleOptional维度都为1时,支持大于65535。x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。 |
| 307 | - x1数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2-6维ND格式,transposeX1为false情况。其中当x1数据类型为INT4时,维度表示:(batch,m,k),要求k为偶数,当x1数据类型为INT32时,每个INT32数据存放8个INT4数据,对应维度表示:(batch,m,k // 8),要求k为8的倍数。 | 307 | - x1数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2-6维ND格式,transposeX1为false情况。其中当x1数据类型为INT4时,维度表示:(batch,m,k),要求k为偶数,当x1数据类型为INT32时,每个INT32数据存放8个INT4数据,对应维度表示:(batch,m,k // 8),要求k为8的倍数。 |
| 308 | - x2数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2维ND格式。 | 308 | - x2数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2维ND格式。 |
| 309 | - 数据类型为INT4时,在transposeX2为true情况下各个维度表示:(n,k),要求k为偶数;在transposeX2为false情况下各个维度表示:(k,n),要求n为偶数。 | 309 | - 数据类型为INT4时,在transposeX2为true情况下各个维度表示:(n,k),要求k为偶数;在transposeX2为false情况下各个维度表示:(k,n),要求n为偶数。 |
| @@ -471,8 +471,8 @@ aclnnStatus aclnnQuantMatmulWeightNz( | |||
| 471 | <details> | 471 | <details> |
| 472 | <summary><term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term>、<term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term></summary> | 472 | <summary><term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term>、<term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term></summary> |
| 473 | 473 | ||
| 474 | - - x1的最后一维大小不能超过65535,x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。 | 474 | + - x1的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,x2Scale的dtype为FLOAT32或BFLOAT16且x2Scale和x1Scale维度都为1时,支持大于65535。x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。 |
| 475 | - - x2的最后一维大小不能超过65535,x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。 | 475 | + - x2的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,x2Scale的dtype为FLOAT32或BFLOAT16且x2Scale和x1Scale维度都为1时,支持大于65535。x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。 |
| 476 | - 支持调用本接口前,通过[aclnnTransMatmulWeight](https://gitcode.com/cann/ops-math/blob/master/conversion/trans_data/docs/aclnnTransMatmulWeight.md)对format为ND的x2处理得到AI处理器亲和数据排布格式。 | 476 | - 支持调用本接口前,通过[aclnnTransMatmulWeight](https://gitcode.com/cann/ops-math/blob/master/conversion/trans_data/docs/aclnnTransMatmulWeight.md)对format为ND的x2处理得到AI处理器亲和数据排布格式。 |
| 477 | 477 | ||
| 478 | - 当原始ND的后两维中存在某一维度为1时,无法使用weightNz特性,本接口不支持此种场景。 | 478 | - 当原始ND的后两维中存在某一维度为1时,无法使用weightNz特性,本接口不支持此种场景。 |