深度学习——RNN（1）RNN基础LSTM

DC童生

发布于 2018-06-04 14:55:48

9670

发布于 2018-06-04 14:55:48

文章被收录于专栏：机器学习原理

前言：为什么有BP神经网络、CNN，还需要RNN? BP神经网络和CNN的输入输出都是互相独立的，也就是说它模拟了神经元之间的信息传递过程，但是作为人，我们依旧会记得小时候的很多事情，这就需要RNN了

RNN基础

实际应用中有些场景输出内容和之前的内容是有关联的。 RNN引入“记忆”的概念；递归指其每一个元素都执行相同的任务，但是输出依赖于输入和“记忆”。所以说RNN一般应用到NLP当中。

循环神经网络中的“循环”体现在哪？可以前bp神经网络不同的是，输入一个x，产生一个状态，保存，把这个状态作为输入，输入到下一次循环中，也就是说，把当前的信息进行记忆。用图可以直观理解。

时间就向前推进，此时的状态s1作为时刻1的记忆状态将参与下一个时刻的预测活动，也就是：

以此类推，可得：

其中f可以是tanh,relu,sigmoid等激活函数，g通常是softmax也可以是其他。值得注意的是，我们说递归神经网络拥有记忆能力，而这种能力就是通过W将以往的输入状态进行总结，而作为下次输入的辅助。可以这样理解隐藏状态： h=f(现有的输入+过去记忆总结)

反向传播 bp神经网络用到的误差反向传播方法将输出层的误差总和，对各个权重的梯度 ∇U,∇V,∇W，求偏导数，然后利用梯度下降法更新各个权重。对于每一时刻t的RNN网络，网络的输出ot都会产生一定误差et，误差的损失函数，可以是交叉熵也可以是平方误差等等。那么总的误差为E=∑tet，我们的目标就是要求取:

用到链式求导法则，w的偏导如下：

u，V同理可以得到问题，由于反向传播过程中，出现多个小于一想乘的情况，容易出现梯度消失，这时候LSTM和GRU模型便后续被推出了？由于它们都有特殊的方式存储”记忆”，那么以前梯度比较大的”记忆”不会像简单的RNN一样马上被抹除，因此可以一定程度上克服梯度消失问题。

LSTM是RNN的一种，大体结构一致，区别在于： LSTM的“记忆细胞”是改造过的该记录的信息会一直传递，不该记录的信息会被截断掉. RNN 在语音识别，语言建模，翻译，图片描述等问题的应用的成功，都是通过 LSTM 达到的。

LSTM结构传统的RNN“细胞”结构：所有 RNN 都具有一种重复神经网络模块的链式的形式。在标准的 RNN 中，这个重复的模块只有一个非常简单的结构，例如一个 tanh 层。

LSTM结构：单一神经网络层，这里是有四个，以一种非常特殊的方式进行交互。

图中使用的各种元素的图标：

每一条黑线传输着一整个向量，从一个节点的输出到其他节点的输入。粉色的圈代表 pointwise 的操作，诸如向量的和，而黄色的矩阵就是学习到的神经网络层。合在一起的线表示向量的连接，分开的线表示内容被复制，然后分发到不同的位置。

LSTM怎么控制“细胞状态”？ LSTM可以通过gates(“门”)结构来去除或者增加“细胞状态”的信息包含一个sigmoid神经网络层次和一个pointwist乘法操作 Sigmoid层输出一个0到1之间的概率值，描述每个部分有多少量可以通过，0表示“不允许任务变量通过”，1表示“运行所有变量通过” LSTM中主要有三个“门”结构来控制“细胞状态”