首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的训练过程中使用了哪些优化技巧?

Transformer 的训练过程中使用了哪些优化技巧?

词条归属:Transformer

1. 优化器与学习率调度

原始 Transformer 采用 Adam 优化器,并配合预热(Warmup)学习率调度:训练初期逐步升高学习率以避免早期发散,随后再按策略衰减。预热机制对深层注意力模型的稳定收敛至关重要。

2. 标签平滑

训练中使用标签平滑(Label Smoothing),将正确目标 token 的部分概率质量分散到其他 token 上,作为一种正则化手段,有助于缓解过拟合、提升泛化表现。

3. 残差与归一化的稳定作用

如前所述,残差连接与层归一化的组合为深层网络的梯度流动提供了保障,是大规模堆叠层数时维持训练稳定的基础技巧。这些技巧共同支撑了 Transformer 在大规模数据上的可靠训练。

相关文章
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券