标准注意力受 HBM 带宽支配:长序列下
S 矩阵
O(N2) 读写主导耗时,且显存
O(N2) 存不下。FlashAttention-1(2022)用切块 + Online Softmax + 反传重算(不存
S)把 HBM 访问降一个数量级、显存从
O(N2) 降到
O(N),64K 序列上比 PyTorch eager 快 2-4 倍;FA-2(2023)做多头并行、把
N2 的 softmax 开销移出并行域,约再快 2 倍;FA-3(2024)用 Hopper 的 warp specialization + TMA 异步拷贝,并把 FP8 引入 kernel。