论文标题:Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling
作者:Yiding Liu*, Yifan Hu*, Hongjie Xia*, Peiyuan Liu*, Hongzhou Chen, Xilin Dai, Zewei Dong†, Jiang-Ming Yang
作者单位:蚂蚁国际(Ant International)
论文链接:https://arxiv.org/abs/2605.27286
代码链接:https://github.com/ant-intl/Falcon-TST

时间序列基础模型正在改变传统的时序预测流程。相比针对每个数据集单独训练模型,基础模型希望通过大规模跨领域预训练,在新任务上直接迁移或少量适配,从而降低重复训练和调参成本。
不过,在多变量时间序列预测中,一个核心问题仍然存在:不同变量往往对应不同物理含义、不同量纲和不同动态模式,直接把它们放在同一个原始变量空间中建模,并不一定能得到稳定、可迁移的变量关系表示。
已有时间序列基础模型中,很多方法仍然以单变量序列为基本建模对象。这样做具有较好的通用性,但会弱化真实系统中普遍存在的变量间相互作用。另一些工作尝试通过 flatten、group attention 或 raw-space mixing 的方式引入跨变量交互,但这些方法通常仍然在原始变量空间内操作。论文指出,这会带来两个问题:一是异构变量之间缺乏显式语义对齐机制;二是标准非负注意力更擅长表达聚合关系,难以刻画现实系统中常见的正相关与负相关并存的相互作用。

针对这些问题,蚂蚁国际提出了 Falcon-X。该方法的主要思路是:不直接在原始变量空间中混合不同变量,而是先将变量映射到一个统一的潜在原型空间,再在该空间中进行跨变量交互,最后通过路由机制还原到各变量对应的预测轨迹。
从研究定位看,Falcon-X 不是一个面向单个数据集的小模型,而是一个面向异构多变量建模的时间序列基础模型。论文报告的模型规模为 591M 参数,并在 GIFT-Eval 与 fev-bench 两个基准上进行了评估。
时间序列预测长期以来主要依赖特定数据集上的模型训练。例如,在电力、交通、气象、金融、Web 流量等场景中,模型通常需要根据具体数据集重新训练。随着大规模预训练的发展,时间序列基础模型尝试从大量跨领域数据中学习通用时间模式,再迁移到新的预测任务上。
现有时间序列基础模型大体可以分为两类。第一类偏向单变量建模,即每个变量主要根据自身历史进行预测。这类方法实现简单,也便于跨数据集迁移,但会忽略变量之间的联动关系。第二类尝试进行多变量建模,例如把多个变量拼接成一个序列,或在变量组内部进行 attention。这类方法可以利用跨变量信息,但当不同数据集的变量含义差异很大时,直接在原始变量空间中交互可能会引入语义错配。

以真实系统为例,电力负荷、天气变量、交通流量、业务指标等数据具有明显异构性。即使它们都可以表示为时间序列,不同变量的单位、噪声水平、周期性和动态规律也可能完全不同。如果模型只依赖共享 Transformer 参数来隐式吸收这些差异,那么跨领域迁移更像是参数共享带来的副产品,而不是一个清晰的变量语义组织过程。
此外,多变量关系并不总是简单的“相似即相关”。在不少系统中,变量之间既可能存在协同变化,也可能存在相反方向的变化。例如,一个变量上升时,另一个变量可能同步上升,也可能由于约束关系而下降。标准 attention 的权重一般是非负的,更自然地表达加权聚合关系,但对这种正负依赖并存的建模能力有限。
Falcon-X 的出发点是:先把异构物理变量从原始空间中解耦出来,映射到统一的潜在原型空间,再在这个空间中建模可复用的跨变量结构。

Falcon-X 是一个 encoder-only 的时间序列基础模型。整体流程可以概括为四个部分:
其中,Variate Attention 是 Falcon-X 的核心。它包含三个模块:Unified Prototype Diff-Attention、Latent Entity Attention 和 Variate Reassembly Router。
Falcon-X 将预测任务组织为一种 masked reconstruction 形式。给定历史窗口和未来预测区间,模型会把未来目标位置替换为占位 token,使输入和输出可以被统一处理。
为了适应不同领域、不同量纲的数据,论文采用实例级归一化流程,并在归一化中引入 arcsine transformation。需要注意的是,均值和标准差只根据已观测位置计算,缺失位置和未来 mask 不会简单参与统计。这一点对包含缺失值或不规则采样的数据更稳健。
随后,模型将归一化后的数值序列与两类辅助信息拼接:
增强后的序列被划分为非重叠 patch,并通过 residual patch embedding 投影到隐藏空间。这里的 patch 表示与近年来许多时序 Transformer 工作一致,目的是降低长序列建模成本,同时提取局部时间模式。
在进入跨变量交互之前,Falcon-X 先使用 Time Attention 对每个变量自身的时间变化进行建模。具体来说,Time Attention 由多层 Transformer encoder 组成,并独立作用于各变量的时间维度。
这种设计有一个直观动机:无论跨变量依赖是否强,每个变量自身的趋势、周期、突变和局部波动都是预测的基础。如果过早、过强地混合变量信息,可能会破坏变量自身的时间结构。因此,Falcon-X 将时间建模作为第一阶段,把变量自身动态表示为后续跨变量交互的输入。
Unified Prototype Diff-Attention(UPDA)的目标是解决异构变量之间的语义对齐问题。与直接在原始变量空间中做 attention 不同,UPDA 引入一组全局共享、可学习的潜在原型,将不同数据集、不同实体、不同变量数目的输入统一映射到固定维度的原型空间。
论文进一步将原型分为两类:
可以用一个简化形式理解该机制:
这里的表达式只是为了说明机制含义:模型分别计算输入变量与正、负原型之间的亲和度,再通过差分形式得到统一原型表示。论文中还加入了原型正交约束,用于增强正负原型之间的语义区分度。
这一设计的重点不在于简单增加 attention 分支,而在于让变量关系不再局限于“非负加权聚合”。模型可以显式表达某些变量模式之间的协同关系,也可以表达相反变化带来的负向依赖。
UPDA 将不同变量对齐到统一原型空间后,Falcon-X 使用 Latent Entity Attention(LEA)进行跨变量交互。此时,模型不再直接面对不同物理变量的原始维度,而是在维度无关的潜在空间中处理全局依赖。
这一步的好处是,跨变量建模可以脱离具体数据集的变量数量和变量名称。不同数据集中的变量虽然物理含义不同,但如果它们在时间结构上存在可复用模式,就有机会在原型空间中共享和迁移。
从实现角度看,LEA 使用标准多头注意力机制,对 entity 与 prototype 维度进行全局交互。相比直接在高维原始变量空间中全连接 attention,这种“先对齐、再交互”的方式更有利于处理变量数变化较大的异构数据。
统一原型空间适合跨变量交互,但最终预测仍然需要回到原始变量对应的物理空间。Falcon-X 因此设计了 Variate Reassembly Router(VRR)。
VRR 可以理解为一个 request-and-dispatch 过程:
论文还引入 gated residual connection 来控制跨变量上下文的融合强度。这个设计比较重要,因为并不是所有数据集都具有强跨变量依赖。在变量相关性较弱的系统中,强行引入全局上下文可能反而带来噪声;在相关性较强的系统中,跨变量信息又可能提供有效补充。门控残差连接使模型能够在这两种情况之间进行调节。
Falcon-X 使用分位数预测头输出概率预测结果,而不是只给出单一点预测。模型对多个分位数进行预测,并通过 Quantile Loss 进行优化。对于实际应用而言,概率预测可以给出更完整的不确定性信息,例如中位数预测、上界预测和下界预测。
整体训练目标由预测损失和原型正交约束共同构成。预测完成后,模型通过对应的反归一化流程将输出映射回原始尺度。
论文报告,Falcon-X 的预训练语料包含真实世界数据和合成数据。真实数据主要来自 GIFT-Eval、Chronos 和 QuitoBench 等时间序列资源,覆盖自然、能源、交通、金融、医疗、Web 和销售等领域。
由于高质量多变量时间序列数据相对有限,论文还构造了合成多变量数据,主要包括两类方式:
从方法上看,这样做可以增加模型在训练阶段看到的跨变量结构类型。不过也需要注意,合成依赖并不等同于真实世界中的因果关系或业务机制。因此,在具体应用中仍然需要结合目标场景验证模型的迁移效果。

Falcon-X 基于 Megatron-LM 构建训练系统,并在 NVIDIA B200-180GB GPU 集群上进行预训练。

论文在 GIFT-Eval 上使用 MASE 和 CRPS 作为指标。MASE 衡量点预测误差,CRPS 用于评价概率预测分布的校准程度。
根据论文报告,Falcon-X 在 GIFT-Eval 上取得 0.687 MASE 和 0.485 CRPS 的结果,并在图中位于整体领先位置。这个结果说明,统一原型空间与跨变量交互机制在该基准上具有较好的效果。
需要强调的是,这里的结论应限定在论文实验设置和 GIFT-Eval 版本下。时间序列基础模型的 leaderboard 可能随着新模型和新提交发生变化,因此发布时建议再次核对最新榜单。

在 fev-bench 上,Falcon-X 的表现同样具有竞争力,但需要更谨慎地表述。论文报告 Falcon-X 取得 0.689 MASE 和 0.513 CRPS,略低于 Chronos-2 的 0.645 MASE 和 0.485 CRPS。论文同时指出,Falcon-X 在该实验中严格依赖 endogenous target series,没有使用额外的 past-only 或 future-known covariates。在这一限制下,它仍然接近 Chronos-2,并优于多种近期基础模型。这个结果支持了 Falcon-X 在异构多变量零样本预测中的有效性,但不应被表述为在所有指标和所有基准上全面领先。

论文对 Falcon-X 的关键模块和训练策略进行了消融分析。结果主要支持以下几点:
这些结果与论文的核心假设一致:Falcon-X 的提升不是单一模块带来的,而是来自时间建模、原型对齐、正负依赖建模、动态还原和训练策略的组合。
论文比较了 Falcon-X 和 Chronos-2 在不同推理范式下的表现。对于 Chronos-2,论文观察到 group attention 是否启用对 GIFT-Eval 表现影响较小,作者将其解释为 raw-space variate mixing 中存在一定语义塌缩现象。
与此相比,Falcon-X 在多变量推理模式下相对于单变量推理模式有稳定增益,同时没有明显损害单变量预测表现。这一实验支持了论文的一个重要观点:跨变量信息需要通过合适的对齐和路由机制引入,不能只依赖原始变量空间中的简单混合。

论文分析了 Time Attention 与 Latent Entity Attention 的层数分配。结果显示,充分的时间建模能力是预测基础,而过多跨变量路由层可能会损害表现。这说明跨变量建模不是越强越好,而是需要与变量自身时间建模保持平衡。
论文还分析了潜在原型维度的影响。过小的原型维度会造成信息瓶颈,过大的维度则可能引入冗余。模型需要在表达能力和噪声控制之间取得平衡。
在模型规模方面,论文比较了 59M、253M 和 591M 参数设置,并观察到随着模型规模增加,MASE 和 CRPS 均有改善。这里可以认为 Falcon-X 在论文实验范围内表现出较清晰的 scaling 趋势,但是否能继续外推到更大模型,需要更多实验验证。
论文给出了 GIFT-Eval 中的代表性预测案例。在 ETT1/15T 的高相关序列上,单变量推理模式由于缺少全局上下文,预测轨迹会逐渐偏离真实值;多变量推理下,Falcon-X 可以利用跨变量信号对轨迹进行校正。

论文还展示了正相关与负相关关系的案例。对于同步变化的变量,Falcon-X 能建模正向相关;对于变化方向相反的变量,模型也能捕捉负向依赖。这个部分主要用于说明 Unified Prototype Diff-Attention 在正负依赖建模上的可解释性。

Falcon-X 针对异构多变量时间序列基础模型中的语义对齐和关系表达问题,提出了统一原型空间建模框架。它先通过 Time Attention 提取各变量自身的时间动态,再通过 Unified Prototype Diff-Attention 将变量映射到正负原型空间,随后使用 Latent Entity Attention 建模潜在空间中的跨变量依赖,最后通过 Variate Reassembly Router 回到变量特定预测表示。
实验结果显示,Falcon-X 在 GIFT-Eval 上取得较好表现,在 fev-bench 上也具有竞争力。更重要的是,论文为多变量时间序列基础模型提供了一个值得讨论的方向:跨变量建模不应只关注变量是否交互,还应关注变量在什么空间中交互、以什么形式表达正负依赖,以及如何把全局信息稳健地还原到具体变量上。
[1] Yiding Liu, Yifan Hu, Hongjie Xia, Peiyuan Liu, Hongzhou Chen, Xilin Dai, Zewei Dong, Jiang-Ming Yang. Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling. arXiv:2605.27286, 2026.
[2] Taha Aksu et al. Gift-EVAL: A benchmark for general time series forecasting model evaluation. arXiv:2410.10393, 2024.
[3] Oleksandr Shchur et al. fev-bench: A realistic benchmark for time series forecasting. arXiv:2509.26468, 2025.
[4] Abdul Fatir Ansari et al. Chronos: Learning the language of time series. TMLR, 2024.
[5] Abdul Fatir Ansari et al. Chronos-2: From univariate to universal forecasting. arXiv:2510.15821, 2025.
[6] Tianzhu Ye et al. Differential Transformer. ICLR, 2025.