已合并
x1 x2 int8输入,scale为float32和bfloat32场景,且为perchannel和pertoken场景支持大于65535,修复资料 #6978
x1 x2 int8输入,scale为float32和bfloat32场景,且为perchannel和pertoken场景支持大于65535,修复资料 #6978
已合并
wmg1创建于 7月3日
2 个文件变更+4-4
@@ -302,8 +302,8 @@ aclnnStatus aclnnQuantMatmulV4(
302 - out数据类型支持FLOAT16、INT8,当pertokenScaleOptional不为空tensor时,out数据类型只支持FLOAT16。302 - out数据类型支持FLOAT16、INT8,当pertokenScaleOptional不为空tensor时,out数据类型只支持FLOAT16。
303 303 
304 - <term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term><term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term>304 - <term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term><term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term>
305- - x1的最后一维大小不能超过65535,x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。305+ - x1的最后一维大小不能超过65535,但当x1和x2dtype为INT8,scale的dtype为FLOAT32或BFLOAT16且scale和pertokenScaleOptional维度都为1时,支持大于65535。x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。
306- - x2的最后一维大小不能超过65535,x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。306+ - x2的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,scale的dtype为FLOAT32或BFLOAT16且scale和pertokenScaleOptional维度都为1时,支持大于65535。x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。
307 - x1数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2-6维ND格式,transposeX1为false情况。其中当x1数据类型为INT4时,维度表示:(batch,m,k),要求k为偶数,当x1数据类型为INT32时,每个INT32数据存放8个INT4数据,对应维度表示:(batch,m,k // 8),要求k为8的倍数。307 - x1数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2-6维ND格式,transposeX1为false情况。其中当x1数据类型为INT4时,维度表示:(batch,m,k),要求k为偶数,当x1数据类型为INT32时,每个INT32数据存放8个INT4数据,对应维度表示:(batch,m,k // 8),要求k为8的倍数。
308 - x2数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2维ND格式。308 - x2数据类型支持INT8、INT32、INT4。当数据类型为INT32、INT4时,为INT4量化场景,当前仅支持2维ND格式。
309 - 数据类型为INT4时,在transposeX2为true情况下各个维度表示:(n,k),要求k为偶数;在transposeX2为false情况下各个维度表示:(k,n),要求n为偶数。309 - 数据类型为INT4时,在transposeX2为true情况下各个维度表示:(n,k),要求k为偶数;在transposeX2为false情况下各个维度表示:(k,n),要求n为偶数。
@@ -471,8 +471,8 @@ aclnnStatus aclnnQuantMatmulWeightNz(
471<details>471<details>
472<summary><term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term><term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term></summary>472<summary><term>Atlas A2 训练系列产品/Atlas A2 推理系列产品</term><term>Atlas A3 训练系列产品/Atlas A3 推理系列产品</term></summary>
473 473 
474- - x1的最后一维大小不能超过65535,x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。474+ - x1的最后一维大小不能超过65535,但当x1和x2dtype为INT8,x2Scale的dtype为FLOAT32或BFLOAT16且x2Scale和x1Scale维度都为1时,支持大于65535。x1的最后一维指transposeX1为true时的m或transposeX1为false时的k。
475- - x2的最后一维大小不能超过65535,x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。475+ - x2的最后一维大小不能超过65535,但当x1和x2的dtype为INT8,x2Scale的dtype为FLOAT32或BFLOAT16且x2Scale和x1Scale维度都为1时,支持大于65535。x2的最后一维指transposeX2为true时的k或transposeX2为false时的n。
476 - 支持调用本接口前,通过[aclnnTransMatmulWeight](https://gitcode.com/cann/ops-math/blob/master/conversion/trans_data/docs/aclnnTransMatmulWeight.md)对format为ND的x2处理得到AI处理器亲和数据排布格式。476 - 支持调用本接口前,通过[aclnnTransMatmulWeight](https://gitcode.com/cann/ops-math/blob/master/conversion/trans_data/docs/aclnnTransMatmulWeight.md)对format为ND的x2处理得到AI处理器亲和数据排布格式。
477 477 
478 - 当原始ND的后两维中存在某一维度为1时,无法使用weightNz特性,本接口不支持此种场景。478 - 当原始ND的后两维中存在某一维度为1时,无法使用weightNz特性,本接口不支持此种场景。