循环神经网络必须在时间步 t-1 完成后才能计算时间步 t,本质上是串行过程,难以充分利用 GPU 的并行能力。Transformer 用注意力替代循环状态,序列中所有位置可以在同一时刻并行计算表示,大幅提升训练效率。
由于并行化能力增强,Transformer 可以在更大规模的数据集上以更低的时间成本完成训练。原始论文报告,模型在 8 块 P100 GPU 上训练约 3.5 天即可在 WMT 2014 英法翻译任务上取得 41.8 BLEU 的单模型最优结果,训练成本远低于同期基于循环网络的模型。
并行计算能力使 Transformer 天然适配大规模分布式训练,为后续将模型参数扩展到数百亿乃至数千亿提供了工程前提。国内主流大模型如腾讯混元即基于 Transformer 架构,依托大规模并行训练实现能力扩展。