稀疏注意力通过只计算一部分 token 之间的注意力来降低开销。代表性工作包括 2019 年的 Sparse Transformer(将复杂度降至 O(n√n))、2020 年的 Longformer(滑动窗口加少量全局 token)和 BigBird(随机加局部加全局,兼具通用逼近性质)。
线性注意力通过核技巧或随机特征近似 softmax,将复杂度降为线性 O(n)。代表性方法包括 Linformer(将键值投影到低维)和 Performer(用正交随机特征近似 softmax 核)。这类方法在长序列上速度优势明显,但在长上下文召回等任务上精度通常略有损失。
FlashAttention 是另一条影响深远的路线,它不改变注意力的数学定义,而是通过分块计算和核融合,将注意力运算留在片上高速缓存中完成,避免在显存中物化完整的注意力矩阵,从而实现线性内存占用和数倍加速。它已成为 PyTorch、JAX 及主流推理框架的默认注意力内核,其后续版本 FlashAttention-2(2023)、FlashAttention-3(2024)依次提升了并行度与硬件利用率;2026 年 3 月发布的 FlashAttention-4 面向 Blackwell 架构(如 B200)进行算法与内核协同设计,在 BF16 精度下性能可达约 1613 TFLOPs/s。