什么是 FlashAttention?一种 IO 感知的精确注意力算法
FlashAttention 是一种 IO 感知(IO-aware)的精确注意力(exact attention)算法,由 Tri Dao 等人在 2022 年的论文中提出。它通过分块(tiling)减少 GPU 高带宽显存(HBM)与片上 SRAM 之间的读写次数,在不牺牲模型质量的前提下加速 Transformer 训练。官方实现由 Dao-AILab 维护,并已演进到 FlashAttention-2、FlashAttention-3 与 FlashAttention-4。