已关闭
[Feature]: 优化HSTU_V1 forward算子的模版编译策略,减少算子包体积 #27
QianZH97创建于 6 天前关闭于 6 天前
6 天前 添加了label:feature
6 天前 关联了看板:MindSDK版本issue看板
6 天前 修改标题为 “[Feature]: 优化HSTU_V1 forward算子的模版编译策略,减少算子包体积”,原标题为“[Feature]: 优化HSTU_V1算子编译策略,减少算子包体积”
6 天前 修改标题为 “[Feature]: 优化HSTU_V1 forward算子的模版编译策略,减少算子包体积”,原标题为“[Feature]: 优化HSTU_V1算子编译策略,减少算子包体积”
6 天前 关联了pull request:[feat][ops] hstu_v1 forward模板压缩
6 天前 关联了里程碑:ops-rec 26.2.0
6 天前 关闭了 issue
6 天前 issue状态由 TODO 改变为 DONE
6 天前 添加了label:resolved
提交提案之前,请先检索仓库内是否已有相同的提案,如已有请在同一提案中进行讨论。
💻 需求背景、当前现状、期望实现的功能内容、具体的设计方案、以及测试方案
背景:HSTU_V1算子上库后,ops-rec whl包体积从20MB冲到了250MB,分析发现HSTU_V1 forward占用了90%的体积,原因是HSTU_V1 forward编译时使用的模版编译策略有问题。

目标:希望能优化HSTU_V1 forward的模版编译策略,将ops-rec的整体whl包控制在100MB以内。优化内容应包括:
1、研究tiling模板下kernel共享op的机制,对tiling编程模板下多kernel共享单个op进行拆分,使得dense、jagged,paged的hstu完全隔离,不再编译冗余模板
2、解析tiling模板编程的宏原型,利用原型宏对jagged的不同数据类型模板进行编译拆分,由原本的所有类型共同编译所有模板改造为每个数据类型编译自己需要的模板
替代方案
补充说明
欢迎加入社区,感谢您对社区的贡献 🎉!