经典系统2022
FlashAttention:把注意力写成 IO 感知算法
FlashAttention: Fast and Memory-Efficient Exact Attention
FlashAttention 提醒我们:注意力的瓶颈经常是搬数据,不是算 FLOPs。它按 GPU SRAM 做分块并在反向重算中间量,得到与标准算法等价的精确注意力,同时大幅减少显存读写。
Tri Dao, Daniel Y. Fu, Stefano Ermon et al.·NeurIPS5.0k 引用1.5k 阅读