Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
对原有的随机数生成算子进行了功能增强与性能优化。核心目标是StatelessRandomUniformV2算子接口新增一个支持设备张量直接输入的特性,以消除不必要的设备到主机(D2H)数据拷贝。同时,新增了StatelessRandomUniformV3融合算子,该算子将随机数生成与范围缩放计算融合,旨在替代上层aclnn调用中需要调用多个算子的链式操作。
单个算子调用可以减少内核启动次数、降低内存占用并提升整体性能
总体思路:收编多个算子的链式操作,将原有的在aclnn侧的多个小算子拼接实现功能归一至kernel侧,调用一个算子即可完成要求
💡 备注(选填)
/assign @gh_M
关联PR已合入,关闭此issue。
Thanks for sending an requirement! Please fill in the following template to help quickly solve your problem.
一、背景信息 (必填)
对原有的随机数生成算子进行了功能增强与性能优化。核心目标是StatelessRandomUniformV2算子接口新增一个支持设备张量直接输入的特性,以消除不必要的设备到主机(D2H)数据拷贝。同时,新增了StatelessRandomUniformV3融合算子,该算子将随机数生成与范围缩放计算融合,旨在替代上层aclnn调用中需要调用多个算子的链式操作。
二、价值/作用 (必填)
单个算子调用可以减少内核启动次数、降低内存占用并提升整体性能
三、设计方案 (必填)
总体思路:收编多个算子的链式操作,将原有的在aclnn侧的多个小算子拼接实现功能归一至kernel侧,调用一个算子即可完成要求
3.1 使能方式(涉及哪些框架:如Aclnn直调、Pytorch训练等)
3.2 总体设计
3.2.1 算子支持的数据类型
3.2.2 host侧设计
3.2.3 kernel侧设计
3.3 支持硬件
3.4 算子约束限制
💡 备注(选填)