原始 Transformer 采用 Adam 优化器,并配合预热(Warmup)学习率调度:训练初期逐步升高学习率以避免早期发散,随后再按策略衰减。预热机制对深层注意力模型的稳定收敛至关重要。
训练中使用标签平滑(Label Smoothing),将正确目标 token 的部分概率质量分散到其他 token 上,作为一种正则化手段,有助于缓解过拟合、提升泛化表现。
如前所述,残差连接与层归一化的组合为深层网络的梯度流动提供了保障,是大规模堆叠层数时维持训练稳定的基础技巧。这些技巧共同支撑了 Transformer 在大规模数据上的可靠训练。