首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 如何处理长序列数据?

Transformer 如何处理长序列数据?

词条归属:Transformer

1. 长序列带来的挑战

标准自注意力的时间和空间复杂度均为序列长度的平方级(O(n²))。当序列长度增大时,注意力分数矩阵的存储与计算开销急剧上升,成为处理长文档、长上下文场景的主要瓶颈。

2. 上下文窗口的扩展思路

为应对长序列,实践中发展出多条技术路线:通过滑动窗口限制每个位置的关注范围,通过稀疏注意力只计算部分 token 对,或通过线性化近似降低复杂度。这些方法在保持性能的同时,使模型能够处理数十万乃至百万级 token 的上下文。

3. 位置外推技术

针对超出训练长度的序列,还可通过位置编码外推技术(如 NTK、YaRN 等)调整位置编码尺度,使模型在推理阶段支持更长的上下文窗口,而无需从头重新训练。

相关文章
Informer:用于长序列时间序列预测的新型transformer 模型
transformer 彻底改变了自然语言处理,并在神经机器翻译,分类和命名实体识别等领域进行了重大改进。最初,transformer 在时间序列领域很难应用。但是在过去的一年半中,出现了一些用于时间序列分类和预测的transformer 变体。我们已经看到了诸如时间融合,卷积,双阶段注意力模型以及更多尝试进入时间序列的模型。最新的Informer模型建立在这一趋势的基础上,并合并了几个新的组件。
deephub
2021-04-16
3.8K0
局部注意力机制提升Transformer长序列时间预测
Transformer已成为自然语言处理领域的主流架构,其在时间序列分析(尤其是长周期预测)中也展现出卓越的性能与效率。本文提出局部注意力机制(LAM),一种专为时间序列设计的高效注意力机制。该机制利用时间序列的连续性特征减少注意力分数计算量,并通过张量代数实现O(nlogn)的时间与内存复杂度,较传统注意力机制的O(n^2)显著优化。此外,针对长周期预测模型评估数据集的不足,本文提出一组新数据集。实验表明,搭载LAM的Transformer架构优于现有最先进模型(包括传统注意力机制),验证了该方法的有效性,并揭示了长序列时间序列预测的未来研究方向。
用户11764306
2025-08-05
3320
AAAI 2021最佳论文Informer:效果远超Transformer的长序列预测神器!
在很多实际应用问题中,我们需要对长序列时间序列进行预测,例如用电使用规划。长序列时间序列预测(LSTF)要求模型具有很高的预测能力,即能够有效地捕捉输出和输入之间精确的长程相关性耦合。最近的研究表明,Transformer具有提高预测能力的潜力。
新智元
2021-03-10
1.4K0
AAAI21最佳论文Informer:效果远超Transformer的长序列预测神器!
在很多实际应用问题中,我们需要对长序列时间序列进行预测,例如用电使用规划。长序列时间序列预测(LSTF)要求模型具有很高的预测能力,即能够有效地捕捉输出和输入之间精确的长程相关性耦合。最近的研究表明,Transformer具有提高预测能力的潜力。
炼丹笔记
2021-05-14
1.6K0
如何利用Transformer建立时间序列预测模型
我最近读了一篇非常有趣的论文,叫做 Deep Transformer Models for Time Series Forecasting: The Influenza Prevalence Case。我认为这可能是一个有趣的项目,他的实现是从头开始的,并且可以帮助你了解更多关于时间序列预测。
deephub
2021-05-18
5.8K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券