标准自注意力的时间和空间复杂度均为序列长度的平方级(O(n²))。当序列长度增大时,注意力分数矩阵的存储与计算开销急剧上升,成为处理长文档、长上下文场景的主要瓶颈。
为应对长序列,实践中发展出多条技术路线:通过滑动窗口限制每个位置的关注范围,通过稀疏注意力只计算部分 token 对,或通过线性化近似降低复杂度。这些方法在保持性能的同时,使模型能够处理数十万乃至百万级 token 的上下文。
针对超出训练长度的序列,还可通过位置编码外推技术(如 NTK、YaRN 等)调整位置编码尺度,使模型在推理阶段支持更长的上下文窗口,而无需从头重新训练。