Transformer 的每个子层(多头注意力子层、前馈网络子层)都包裹一层残差连接,即把子层的输入直接加到其输出上。残差连接为梯度提供了直达浅层的通路,显著缓解了深层网络的梯度消失问题,使堆叠数十层成为可能。
每个子层在残差相加之后施加层归一化(Layer Normalization),对当前样本的特征维度进行归一化,稳定激活值的分布。这一组合(残差连接 + 层归一化)是深层 Transformer 能够稳定训练的关键工程基础。
在注意力子层之外,Transformer 每个编码器和解码器层还包含一个逐位置的前馈神经网络(Feed-Forward Network)。该网络对每个位置独立地施加相同的非线性变换,先升维再降维,用于增强模型对每个位置表示的非线性加工能力,其参数在所有位置上共享。