GenericBlockSparseAttentionGrad是通用块稀疏注意力的反向计算算子。依据sparseBlockIdx/sparseBlockCount(稀疏块索引表)定义的索引,仅在被选中的KV块上计算和传播梯度,支持动态、可变长的分块稀疏模式。 新增 GenericBlockSparseAttentionGrad 和 generic_block_sparse_attention_grad_metadata算子
/assign @tramp-ll
GenericBlockSparseAttentionGrad是通用块稀疏注意力的反向计算算子。依据sparseBlockIdx/sparseBlockCount(稀疏块索引表)定义的索引,仅在被选中的KV块上计算和传播梯度,支持动态、可变长的分块稀疏模式。
新增 GenericBlockSparseAttentionGrad 和 generic_block_sparse_attention_grad_metadata算子