首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >Transformer >Transformer 的残差连接和层归一化是如何工作的?

Transformer 的残差连接和层归一化是如何工作的?

词条归属:Transformer

1. 残差连接的作用

Transformer 的每个子层(多头注意力子层、前馈网络子层)都包裹一层残差连接,即把子层的输入直接加到其输出上。残差连接为梯度提供了直达浅层的通路,显著缓解了深层网络的梯度消失问题,使堆叠数十层成为可能。

2. 层归一化的作用

每个子层在残差相加之后施加层归一化(Layer Normalization),对当前样本的特征维度进行归一化,稳定激活值的分布。这一组合(残差连接 + 层归一化)是深层 Transformer 能够稳定训练的关键工程基础。

3. 前馈网络子层

在注意力子层之外,Transformer 每个编码器和解码器层还包含一个逐位置的前馈神经网络(Feed-Forward Network)。该网络对每个位置独立地施加相同的非线性变换,先升维再降维,用于增强模型对每个位置表示的非线性加工能力,其参数在所有位置上共享。

相关文章
Transformer中残差连接和层归一化原理解析
残差连接 是一种将输入直接加到输出上的操作。对于一个子层(如自注意力或前馈网络),其功能可以表示为 $Sublayer(x)$,那么残差连接的输出为:
索旭东
2026-04-14
9250
残差连接和层归一化如何提高GPT、文心一言等大模型的性能
残差连接(Residual Connections)和层归一化(Layer Normalization)在GPT等Transformer模型中起到了关键作用,它们显著提高了模型的性能和稳定性。以下是它们如何提升GPT性能的详细解释:
jack.yang
2025-04-05
6470
解密:OpenAI和DeepMind都用的Transformer是如何工作的
Transformer 是为解决序列转换或问题而设计的架构,该任务将一个输入序列转化为一个输出序列。 语音识别、文本转语音等问题都属于这类任务。
机器之心
2019-04-29
1.5K0
谷歌、DeepMind和OpenAI都在用的Transformer是如何工作的?| 干货
不论是各处霸榜的谷歌BERT、OpenAI最近的强大NLP模型GPT-2,还是DeepMind击败星际2顶尖职业玩家的AlphaStar,背后都有 Transformer的身影。
量子位
2019-04-23
9500
Keras中的Embedding层是如何工作的
在学习的过程中遇到了这个问题,同时也看到了SO中有相同的问题。而keras-github中这个问题也挺有意思的,记录一下。
千灵域
2022-06-17
2.7K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券