Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
BlockSparseAttention新增接口aclnnBlockSparseAttentionV2。 新增qDequantScale、kDequantScale、vDequantScale参数,支持float8量化功能。
降低内存占用和访问,相较非量化场景达到性能提升。
量化级别为Per-Block。Block大小与BlockShape大小保持一致。 MM1阶段结束时随路反量化。 VEC1阶段末尾时对P矩阵量化。 MM2阶段结束时随路反量化。 VEC2阶段末尾时对O矩阵反量化。
/assign @tangkaidi
This issue is already assigned to tangkaidi. Please do not assign repeatedly.
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
Backgroud(背景信息)
BlockSparseAttention新增接口aclnnBlockSparseAttentionV2。
新增qDequantScale、kDequantScale、vDequantScale参数,支持float8量化功能。
Benefit / Necessity (价值/作用)
降低内存占用和访问,相较非量化场景达到性能提升。
Design(设计方案)
量化级别为Per-Block。Block大小与BlockShape大小保持一致。
MM1阶段结束时随路反量化。
VEC1阶段末尾时对P矩阵量化。
MM2阶段结束时随路反量化。
VEC2阶段末尾时对O矩阵反量化。