Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
伪量化(Weight-Only)是在不显著牺牲模型精度的前提下,通过压缩权重存储来减少显存带宽瓶颈,使得大模型在推理场景下获得更高性能。
QBMMV4 切换blaze,补充了相关组件功能。此外还有性能优化改动:MM伪量化采用SWAT自适应滑窗Tiling方案实现,增加Prologue部分对weight进行前处理,两个AIV核通过fp4位运算完成fp8类型转换,并存储为L1上的NZ格式排布,进行MX量化的MMAD计算。
matmul
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
Backgroud(背景信息)
伪量化(Weight-Only)是在不显著牺牲模型精度的前提下,通过压缩权重存储来减少显存带宽瓶颈,使得大模型在推理场景下获得更高性能。
QBMMV4 切换blaze,补充了相关组件功能。此外还有性能优化改动:MM伪量化采用SWAT自适应滑窗Tiling方案实现,增加Prologue部分对weight进行前处理,两个AIV核通过fp4位运算完成fp8类型转换,并存储为L1上的NZ格式排布,进行MX量化的MMAD计算。
Origin(信息来源)
matmul
Benefit / Necessity (价值/作用)
Design(设计方案)