首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Falcon-X|蚂蚁国际提出面向异构多变量时序预测的统一原型空间基础模型

Falcon-X|蚂蚁国际提出面向异构多变量时序预测的统一原型空间基础模型

作者头像
时空探索之旅
发布2026-06-12 16:22:05
发布2026-06-12 16:22:05
2150
举报
文章被收录于专栏:时空探索之旅时空探索之旅

论文标题:Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling

作者:Yiding Liu*, Yifan Hu*, Hongjie Xia*, Peiyuan Liu*, Hongzhou Chen, Xilin Dai, Zewei Dong†, Jiang-Ming Yang

作者单位:蚂蚁国际(Ant International)

论文链接https://arxiv.org/abs/2605.27286

代码链接https://github.com/ant-intl/Falcon-TST

引言

时间序列基础模型正在改变传统的时序预测流程。相比针对每个数据集单独训练模型,基础模型希望通过大规模跨领域预训练,在新任务上直接迁移或少量适配,从而降低重复训练和调参成本。

不过,在多变量时间序列预测中,一个核心问题仍然存在:不同变量往往对应不同物理含义、不同量纲和不同动态模式,直接把它们放在同一个原始变量空间中建模,并不一定能得到稳定、可迁移的变量关系表示

已有时间序列基础模型中,很多方法仍然以单变量序列为基本建模对象。这样做具有较好的通用性,但会弱化真实系统中普遍存在的变量间相互作用。另一些工作尝试通过 flatten、group attention 或 raw-space mixing 的方式引入跨变量交互,但这些方法通常仍然在原始变量空间内操作。论文指出,这会带来两个问题:一是异构变量之间缺乏显式语义对齐机制;二是标准非负注意力更擅长表达聚合关系,难以刻画现实系统中常见的正相关与负相关并存的相互作用。

针对这些问题,蚂蚁国际提出了 Falcon-X。该方法的主要思路是:不直接在原始变量空间中混合不同变量,而是先将变量映射到一个统一的潜在原型空间,再在该空间中进行跨变量交互,最后通过路由机制还原到各变量对应的预测轨迹。

从研究定位看,Falcon-X 不是一个面向单个数据集的小模型,而是一个面向异构多变量建模的时间序列基础模型。论文报告的模型规模为 591M 参数,并在 GIFT-Eval 与 fev-bench 两个基准上进行了评估。

背景介绍

时间序列预测长期以来主要依赖特定数据集上的模型训练。例如,在电力、交通、气象、金融、Web 流量等场景中,模型通常需要根据具体数据集重新训练。随着大规模预训练的发展,时间序列基础模型尝试从大量跨领域数据中学习通用时间模式,再迁移到新的预测任务上。

现有时间序列基础模型大体可以分为两类。第一类偏向单变量建模,即每个变量主要根据自身历史进行预测。这类方法实现简单,也便于跨数据集迁移,但会忽略变量之间的联动关系。第二类尝试进行多变量建模,例如把多个变量拼接成一个序列,或在变量组内部进行 attention。这类方法可以利用跨变量信息,但当不同数据集的变量含义差异很大时,直接在原始变量空间中交互可能会引入语义错配。

以真实系统为例,电力负荷、天气变量、交通流量、业务指标等数据具有明显异构性。即使它们都可以表示为时间序列,不同变量的单位、噪声水平、周期性和动态规律也可能完全不同。如果模型只依赖共享 Transformer 参数来隐式吸收这些差异,那么跨领域迁移更像是参数共享带来的副产品,而不是一个清晰的变量语义组织过程。

此外,多变量关系并不总是简单的“相似即相关”。在不少系统中,变量之间既可能存在协同变化,也可能存在相反方向的变化。例如,一个变量上升时,另一个变量可能同步上升,也可能由于约束关系而下降。标准 attention 的权重一般是非负的,更自然地表达加权聚合关系,但对这种正负依赖并存的建模能力有限。

Falcon-X 的出发点是:先把异构物理变量从原始空间中解耦出来,映射到统一的潜在原型空间,再在这个空间中建模可复用的跨变量结构

Falcon-X 方法概述

Falcon-X 是一个 encoder-only 的时间序列基础模型。整体流程可以概括为四个部分:

  1. Normalization and Tokenization:对输入序列进行实例级归一化、时间戳与观测 mask 增强,并划分为 patch token;
  2. Time Attention:沿时间维度对每个变量的自身动态进行建模;
  3. Variate Attention:通过统一原型空间建模跨变量关系;
  4. Forecasting Head:使用分位数预测头输出概率预测结果。

其中,Variate Attention 是 Falcon-X 的核心。它包含三个模块:Unified Prototype Diff-Attention、Latent Entity Attention 和 Variate Reassembly Router。

1. 归一化与 Tokenization

Falcon-X 将预测任务组织为一种 masked reconstruction 形式。给定历史窗口和未来预测区间,模型会把未来目标位置替换为占位 token,使输入和输出可以被统一处理。

为了适应不同领域、不同量纲的数据,论文采用实例级归一化流程,并在归一化中引入 arcsine transformation。需要注意的是,均值和标准差只根据已观测位置计算,缺失位置和未来 mask 不会简单参与统计。这一点对包含缺失值或不规则采样的数据更稳健。

随后,模型将归一化后的数值序列与两类辅助信息拼接:

  • 相对时间戳,用于帮助模型适应不同采样频率;
  • 观测 mask,用于区分真实观测、缺失位置和被 mask 的未来目标。

增强后的序列被划分为非重叠 patch,并通过 residual patch embedding 投影到隐藏空间。这里的 patch 表示与近年来许多时序 Transformer 工作一致,目的是降低长序列建模成本,同时提取局部时间模式。

2. Time Attention:先建模每个变量自身的时间动态

在进入跨变量交互之前,Falcon-X 先使用 Time Attention 对每个变量自身的时间变化进行建模。具体来说,Time Attention 由多层 Transformer encoder 组成,并独立作用于各变量的时间维度。

这种设计有一个直观动机:无论跨变量依赖是否强,每个变量自身的趋势、周期、突变和局部波动都是预测的基础。如果过早、过强地混合变量信息,可能会破坏变量自身的时间结构。因此,Falcon-X 将时间建模作为第一阶段,把变量自身动态表示为后续跨变量交互的输入。

3. Unified Prototype Diff-Attention:映射到统一原型空间

Unified Prototype Diff-Attention(UPDA)的目标是解决异构变量之间的语义对齐问题。与直接在原始变量空间中做 attention 不同,UPDA 引入一组全局共享、可学习的潜在原型,将不同数据集、不同实体、不同变量数目的输入统一映射到固定维度的原型空间。

论文进一步将原型分为两类:

  • 正向原型,用于表达协同关系或正向语义相似性;
  • 负向原型,用于表达对立关系或负向语义相似性。

可以用一个简化形式理解该机制:

这里的表达式只是为了说明机制含义:模型分别计算输入变量与正、负原型之间的亲和度,再通过差分形式得到统一原型表示。论文中还加入了原型正交约束,用于增强正负原型之间的语义区分度。

这一设计的重点不在于简单增加 attention 分支,而在于让变量关系不再局限于“非负加权聚合”。模型可以显式表达某些变量模式之间的协同关系,也可以表达相反变化带来的负向依赖。

4. Latent Entity Attention:在潜在空间中进行跨变量交互

UPDA 将不同变量对齐到统一原型空间后,Falcon-X 使用 Latent Entity Attention(LEA)进行跨变量交互。此时,模型不再直接面对不同物理变量的原始维度,而是在维度无关的潜在空间中处理全局依赖。

这一步的好处是,跨变量建模可以脱离具体数据集的变量数量和变量名称。不同数据集中的变量虽然物理含义不同,但如果它们在时间结构上存在可复用模式,就有机会在原型空间中共享和迁移。

从实现角度看,LEA 使用标准多头注意力机制,对 entity 与 prototype 维度进行全局交互。相比直接在高维原始变量空间中全连接 attention,这种“先对齐、再交互”的方式更有利于处理变量数变化较大的异构数据。

5. Variate Reassembly Router:从原型空间还原到变量轨迹

统一原型空间适合跨变量交互,但最终预测仍然需要回到原始变量对应的物理空间。Falcon-X 因此设计了 Variate Reassembly Router(VRR)。

VRR 可以理解为一个 request-and-dispatch 过程:

  • 每个变量根据自身时间表示生成 Routing Request,用来表达该变量的身份和轨迹需求;
  • 统一原型空间提供 Prototype Index 和 Source Context;
  • 模型根据 request 与 index 的匹配关系,从原型空间中选择性取回上下文信息;
  • 取回的信息再与变量自身的时间表示融合,生成变量特定的预测表示。

论文还引入 gated residual connection 来控制跨变量上下文的融合强度。这个设计比较重要,因为并不是所有数据集都具有强跨变量依赖。在变量相关性较弱的系统中,强行引入全局上下文可能反而带来噪声;在相关性较强的系统中,跨变量信息又可能提供有效补充。门控残差连接使模型能够在这两种情况之间进行调节。

6. 概率预测头

Falcon-X 使用分位数预测头输出概率预测结果,而不是只给出单一点预测。模型对多个分位数进行预测,并通过 Quantile Loss 进行优化。对于实际应用而言,概率预测可以给出更完整的不确定性信息,例如中位数预测、上界预测和下界预测。

整体训练目标由预测损失和原型正交约束共同构成。预测完成后,模型通过对应的反归一化流程将输出映射回原始尺度。

训练数据与训练设置

论文报告,Falcon-X 的预训练语料包含真实世界数据和合成数据。真实数据主要来自 GIFT-Eval、Chronos 和 QuitoBench 等时间序列资源,覆盖自然、能源、交通、金融、医疗、Web 和销售等领域。

由于高质量多变量时间序列数据相对有限,论文还构造了合成多变量数据,主要包括两类方式:

  1. 基于相似性的多变量构造:从真实单变量序列中计算相似性,将相关序列组合成多变量样本;
  2. 依赖注入式合成:在合成单变量生成器基础上引入显式跨变量依赖,包括同一时刻的依赖以及带有 lead-lag 或 cointegration 特征的时序依赖。

从方法上看,这样做可以增加模型在训练阶段看到的跨变量结构类型。不过也需要注意,合成依赖并不等同于真实世界中的因果关系或业务机制。因此,在具体应用中仍然需要结合目标场景验证模型的迁移效果。

Falcon-X 基于 Megatron-LM 构建训练系统,并在 NVIDIA B200-180GB GPU 集群上进行预训练。

实验分析

1. GIFT-Eval 主结果

论文在 GIFT-Eval 上使用 MASE 和 CRPS 作为指标。MASE 衡量点预测误差,CRPS 用于评价概率预测分布的校准程度。

根据论文报告,Falcon-X 在 GIFT-Eval 上取得 0.687 MASE 和 0.485 CRPS 的结果,并在图中位于整体领先位置。这个结果说明,统一原型空间与跨变量交互机制在该基准上具有较好的效果。

需要强调的是,这里的结论应限定在论文实验设置和 GIFT-Eval 版本下。时间序列基础模型的 leaderboard 可能随着新模型和新提交发生变化,因此发布时建议再次核对最新榜单。

2. fev-bench 结果

在 fev-bench 上,Falcon-X 的表现同样具有竞争力,但需要更谨慎地表述。论文报告 Falcon-X 取得 0.689 MASE 和 0.513 CRPS,略低于 Chronos-2 的 0.645 MASE 和 0.485 CRPS。论文同时指出,Falcon-X 在该实验中严格依赖 endogenous target series,没有使用额外的 past-only 或 future-known covariates。在这一限制下,它仍然接近 Chronos-2,并优于多种近期基础模型。这个结果支持了 Falcon-X 在异构多变量零样本预测中的有效性,但不应被表述为在所有指标和所有基准上全面领先。

3. 消融实验

论文对 Falcon-X 的关键模块和训练策略进行了消融分析。结果主要支持以下几点:

  • 去掉负向原型相关部分会带来明显性能下降,说明显式建模负向依赖对异构多变量交互有帮助;
  • 去掉 gated residual connection 会降低表现,说明跨变量上下文需要按数据情况进行调节,而不是无条件注入;
  • 去掉相对时间戳和观测 mask 会削弱模型对不规则采样与缺失值的稳健性;
  • 训练策略中,变量 shuffle、flexible horizon 采样和 joint training 都对泛化能力有贡献。

这些结果与论文的核心假设一致:Falcon-X 的提升不是单一模块带来的,而是来自时间建模、原型对齐、正负依赖建模、动态还原和训练策略的组合。

4. 多变量推理设置分析

论文比较了 Falcon-X 和 Chronos-2 在不同推理范式下的表现。对于 Chronos-2,论文观察到 group attention 是否启用对 GIFT-Eval 表现影响较小,作者将其解释为 raw-space variate mixing 中存在一定语义塌缩现象。

与此相比,Falcon-X 在多变量推理模式下相对于单变量推理模式有稳定增益,同时没有明显损害单变量预测表现。这一实验支持了论文的一个重要观点:跨变量信息需要通过合适的对齐和路由机制引入,不能只依赖原始变量空间中的简单混合。

5. 参数敏感性与 Scaling 分析

论文分析了 Time Attention 与 Latent Entity Attention 的层数分配。结果显示,充分的时间建模能力是预测基础,而过多跨变量路由层可能会损害表现。这说明跨变量建模不是越强越好,而是需要与变量自身时间建模保持平衡。

论文还分析了潜在原型维度的影响。过小的原型维度会造成信息瓶颈,过大的维度则可能引入冗余。模型需要在表达能力和噪声控制之间取得平衡。

在模型规模方面,论文比较了 59M、253M 和 591M 参数设置,并观察到随着模型规模增加,MASE 和 CRPS 均有改善。这里可以认为 Falcon-X 在论文实验范围内表现出较清晰的 scaling 趋势,但是否能继续外推到更大模型,需要更多实验验证。

6. 案例分析

论文给出了 GIFT-Eval 中的代表性预测案例。在 ETT1/15T 的高相关序列上,单变量推理模式由于缺少全局上下文,预测轨迹会逐渐偏离真实值;多变量推理下,Falcon-X 可以利用跨变量信号对轨迹进行校正。

论文还展示了正相关与负相关关系的案例。对于同步变化的变量,Falcon-X 能建模正向相关;对于变化方向相反的变量,模型也能捕捉负向依赖。这个部分主要用于说明 Unified Prototype Diff-Attention 在正负依赖建模上的可解释性。

总结

Falcon-X 针对异构多变量时间序列基础模型中的语义对齐和关系表达问题,提出了统一原型空间建模框架。它先通过 Time Attention 提取各变量自身的时间动态,再通过 Unified Prototype Diff-Attention 将变量映射到正负原型空间,随后使用 Latent Entity Attention 建模潜在空间中的跨变量依赖,最后通过 Variate Reassembly Router 回到变量特定预测表示。

实验结果显示,Falcon-X 在 GIFT-Eval 上取得较好表现,在 fev-bench 上也具有竞争力。更重要的是,论文为多变量时间序列基础模型提供了一个值得讨论的方向:跨变量建模不应只关注变量是否交互,还应关注变量在什么空间中交互、以什么形式表达正负依赖,以及如何把全局信息稳健地还原到具体变量上

参考文献

[1] Yiding Liu, Yifan Hu, Hongjie Xia, Peiyuan Liu, Hongzhou Chen, Xilin Dai, Zewei Dong, Jiang-Ming Yang. Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling. arXiv:2605.27286, 2026.

[2] Taha Aksu et al. Gift-EVAL: A benchmark for general time series forecasting model evaluation. arXiv:2410.10393, 2024.

[3] Oleksandr Shchur et al. fev-bench: A realistic benchmark for time series forecasting. arXiv:2509.26468, 2025.

[4] Abdul Fatir Ansari et al. Chronos: Learning the language of time series. TMLR, 2024.

[5] Abdul Fatir Ansari et al. Chronos-2: From univariate to universal forecasting. arXiv:2510.15821, 2025.

[6] Tianzhu Ye et al. Differential Transformer. ICLR, 2025.

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-06-11,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 引言
  • 背景介绍
  • Falcon-X 方法概述
    • 1. 归一化与 Tokenization
    • 2. Time Attention:先建模每个变量自身的时间动态
    • 3. Unified Prototype Diff-Attention:映射到统一原型空间
    • 4. Latent Entity Attention:在潜在空间中进行跨变量交互
    • 5. Variate Reassembly Router:从原型空间还原到变量轨迹
    • 6. 概率预测头
  • 训练数据与训练设置
  • 实验分析
    • 1. GIFT-Eval 主结果
    • 2. fev-bench 结果
    • 3. 消融实验
    • 4. 多变量推理设置分析
    • 5. 参数敏感性与 Scaling 分析
    • 6. 案例分析
  • 总结
  • 参考文献
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档