flash-attention:高效加速Transformer注意力机制,支持CUDA/ROCm,多GPU架构优化

Fast and memory-efficient exact attention

分支7Tags19

项目介绍

快速且内存高效的确切注意力机制【此简介由AI生成】

定制我的领域