已关闭
新增 GenericBlockSparseAttentionGrad算子 #4886
陈俊卓创建于 3 天前关闭于 21 小时前
3 天前 修改标题为 “新增 GenericBlockSparseAttentionGrad算子”,原标题为“新增 GenericBlockSparseAttentionGradMetadata 算子”
3 天前 修改标题为 “新增 GenericBlockSparseAttentionGrad算子”,原标题为“新增 GenericBlockSparseAttentionGradMetadata 算子”
3 天前 将 cjz_ 设为负责人
21 小时前 关闭了 issue
19 小时前 添加了label:resolved


Backgroud(背景信息)
MiniMax 发布的新一代多模态理解模型 MiniMax-M3 采用了一种高效的 块稀疏注意力机制 (MiniMax Sparse Attention)。该机制将输入序列划分为若干块,并根据预设的稀疏模式仅计算部分块之间的注意力分数,在保持模型表达能力的同时大幅降低显存占用和计算量。
Benefit / Necessity (价值/作用)
为支持该模型的大规模训练和端到端推理微调,需开发对应的 注意力反向传播算子 (MiniMax Sparse Attention Grad),以正确计算关于 Query、Key、Value 及注意力权重的梯度,并且计算过程需高度匹配前向稀疏模式,同时具备极致的存储和带宽效率。