已关闭
新增 GenericBlockSparseAttentionGrad算子 #4886
陈俊卓创建于  3 天前关闭于  21 小时前
陈俊卓
陈俊卓成员
3 天前 创建

Backgroud(背景信息)
MiniMax 发布的新一代多模态理解模型 MiniMax-M3 采用了一种高效的 ​块稀疏注意力机制 (MiniMax Sparse Attention)​。该机制将输入序列划分为若干块,并根据预设的稀疏模式仅计算部分块之间的注意力分数,在保持模型表达能力的同时大幅降低显存占用和计算量。
Benefit / Necessity (价值/作用)
为支持该模型的大规模训练和端到端推理微调,需开发对应的 ​注意力反向传播算子 (MiniMax Sparse Attention Grad)​,以正确计算关于 Query、Key、Value 及注意力权重的梯度,并且计算过程需高度匹配前向稀疏模式,同时具备极致的存储和带宽效率。

likedislike
陈俊卓陈俊卓成员
3 天前 修改标题为 “新增 GenericBlockSparseAttentionGrad算子”,原标题为“新增 GenericBlockSparseAttentionGradMetadata 算子”
weihao18成员
3 天前 评论:

/assign @cjz_

likedislike
CANN-robotCANN-robot成员
3 天前 将 cjz_ 设为负责人
CANN-robotCANN-robot成员
21 小时前 关闭了 issue
CANN-robotCANN-robot成员
19 小时前 添加了label:resolved