Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
reduce_var算子针对连续小尾轴场景性能劣化。
解决小尾轴场景性能打不过竞品。
对于小尾轴场景使用nddma和转置方式,提升性能。
bf16,fp16,fp32
增加nddma和invert判断函数,满足条件对应flag=1.
💡 备注(选填)
/assign @liaohuming
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
一、背景信息 (必填)
reduce_var算子针对连续小尾轴场景性能劣化。
二、价值/作用 (必填)
解决小尾轴场景性能打不过竞品。
三、设计方案 (必填)
对于小尾轴场景使用nddma和转置方式,提升性能。
3.1 使能方式(涉及哪些框架:如Aclnn直调、Pytorch训练等)
3.2 总体设计
3.2.1 算子支持的数据类型
bf16,fp16,fp32
3.2.2 host侧设计
增加nddma和invert判断函数,满足条件对应flag=1.
3.2.3 kernel侧设计
3.3 支持硬件
3.4 算子约束限制
💡 备注(选填)