已开启
Feature】triton算子(chunk_kda_fwd_intra)迁移mindspeed-ops仓 #6
LinShua创建于 5月18日
Ronald1995
6月11日 评论:
6月11日 评论:
/label add good-first-issue


6月11日 添加了label:good-first-issue
wangx700
6月12日 评论:
6月12日 评论:
/label add triage-review


6月12日 添加了label:triage-review
finepix
6月25日 评论:
6月25日 评论:
认领这个任务


Ronald1995
6月25日 评论:
6月25日 评论:
认领这个任务
@finepix
抱歉,这个算子已经开发上仓了,您可以认领其他任务。https://gitcode.com/org/Ascend/discussions/4


Ronald1995
6月25日 评论:
6月25日 评论:
任务关闭


7月2日 关联了看板:@zeshengzong的看板 20260702
7月3日 关联了看板:MindStudio ISSUE管理
梵高的呐喊
1 天前 评论:
1 天前 评论:
认领该任务


任务描述
基于fla-org/flash-linear-attention开源仓库的triton源码,迁移优化triton算子在NPU上跑通及性能优化。
本期任务的具体信息如下:
(1)算子名称:chunk_kda_fwd_intra
(2) fla-org/flash-linear-attention开放仓库的算子源码链接:
https://github.com/fla-org/flash-linear-attention/blob/v0.4.1/fla/ops/kda/chunk_intra.py
(3) 迁移指导文档:https://gitcode.com/Ascend/triton-ascend/blob/main/docs/zh/programming_guide.md
参考 skill 地址:https://gitcode.com/Ascend/agent-skills/tree/master/skills/simple-vector-triton-gpu-to-npu
(4) 开发平台:Atlas 800T A2或者A3
验收标准
一、任务交付件
本期任务为基于fla-org/flash-linear-attention开放仓库代码进行功能扩展,请合入开发代码。主要开发点如下:
(1) triton算子针对NPU的适配修改优化后的代码
(2) 针对该triton算子的测试用例UT
二、验收标准:
1)精度/性能要求
精度:
对比GPU相同输入算子精度误差小于0.1%
若无GPU标杆,与CPU小算子对齐,精度误差小于0.1%
性能:
补充说明:具体性能对比数据呈现,按 CV类算子达到0.7x竞品, VV类算子达到0.9x竞品
以下以竞品A100为例说明计算具体的性能对比要求:
910B2 VS A100
计算式子:以CV类算子的Cube算力bound场景为例:1.13 * 0.7 =0.8
2)实践文档:
triton算子介绍1篇
3)任务完成标准
本次任务完成标准为:
精度/性能(根据实际要求)达标,PR完成合入,实践文档提交到仓库issue。
PR 合入
本地完成测试验证后,向MindSpeed-Ops的master分支发起PR。
对接人
LinSHua
欢迎加入社区,感谢您对社区的贡献 🎉!