Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
针对mm类算子增加控制l2复用的能力,当前线上默认走l2. 新增pr提供了在onnx图场景下,通过在onnx中增加enable_uncache参数控制算子是否不走l2,如果用户配置为1,算子会在tiling阶段根据输入矩阵的l2复用情况来控制输入是否走l2.当前只对B矩阵做了处理,右矩阵关闭L2条件:baseM全载 + 单滑窗block + 内轴128B对齐 + L1切分块对齐。
部门
/assign
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
Backgroud(背景信息)
针对mm类算子增加控制l2复用的能力,当前线上默认走l2. 新增pr提供了在onnx图场景下,通过在onnx中增加enable_uncache参数控制算子是否不走l2,如果用户配置为1,算子会在tiling阶段根据输入矩阵的l2复用情况来控制输入是否走l2.当前只对B矩阵做了处理,右矩阵关闭L2条件:baseM全载 + 单滑窗block + 内轴128B对齐 + L1切分块对齐。
Origin(信息来源)
部门
Benefit / Necessity (价值/作用)
Design(设计方案)