RNN 的隐状态必须按时间步依次传递,训练难以并行;Transformer 基于注意力,序列中所有位置可同时计算,训练并行度高,能更充分利用 GPU 算力,显著缩短大规模训练时间。
在 RNN 中,相距较远的两个位置之间信息需经过多个中间步骤传递,容易出现梯度消失或爆炸;Transformer 中任意两个位置之间只需一次注意力操作即可直接关联,最大路径长度为常数,更擅长捕捉长距离依赖。
由于并行化程度高、训练更稳定,Transformer 更容易随数据和算力规模扩展,参数可以增长到 RNN 时代难以企及的量级,这也是其成为当代大模型基础架构的根本原因。