TensorFlow从0到1 | 第九章“驱魔”之反向传播大法

上一篇8 万能函数的形态:人工神经网络解封了人工神经网络,如果用非常简短的语言来概括它,我更喜欢维基百科的诠释:

人工神经网络是一种模仿生物神经网络(动物的中枢神经系统,特别是大脑)的结构和功能的数学模型或计算模型,用于对函数进行估计或近似。神经网络由大量的人工神经元联结进行计算。大多数情况下人工神经网络能在外界信息的基础上改变内部结构,是一种自适应系统。

就这样,人类照着上帝创造生灵万物的手法,居然也徒手造出了“活物”,且让它们附体在芯片之中,操纵世事。它们中有庞然大物,有小巧玲珑,不知疲倦,冰冷无情,是为“魔”。

然而要驱动那一堆首尾相连的神经元,让其“活”起来,还有最后一个步骤,就像圣经中神造人时吹的那口生气,即本篇要说的反向传播大法(Backpropagation)。

Backpropagation

神经网络有多少参数

与线性回归的算法框架如出一辙,基于神经网络的机器学习,是基于数据的、运用梯度下降算法来优化网络(减小损失)的过程。

在套用这个算法框架之前,要先搞清楚神经网络的参数及其形式。以经典的3层感知器为例:

3层感知器

第一层是输入层,其中的神经元仅仅提供输出值,并不含有权重和偏置。图中输入层有8个神经元。

第二层是隐藏层,有15个神经元,每个神经元都会接收第一层的8个神经元的输出作为输入,在其内部,加权求和之后还有一个偏置。

第三层是输出层,有10个神经元,每个神经元都会接受第二层的15个神经元的输出作为输入,在其内部,加权求和之后也有一个偏置。

用wjkl来表示一个单独的权重,它代表的是第l层的第j个神经元、与上一层(l-1)第k个神经元输出相对应的权重。或许你对这种表示方法感到有些别扭,但很快就会适应的。以w243为例见下图:

w<sub>24</sub><sup>3</sup>

用bjl来表示第l层上,第j个神经元中的偏置,这个比较显而易见。

基于上述的神经网络结构和对权重和偏置的符号的定义,当前构建的神经网络的参数如下所示:

第2层神经元的权重和偏置
第3层神经元的权重和偏置

基于神经网络的机器学习

第二层神经元的权重120=15x8个,偏置15个,第三层神经元的权重150=10x15个,偏置10个。整个神经网络的参数:295个。一个不算特别复杂的,由33个神经元构成的全连接神经网络,其参数已经达到了295个之多。

所谓的训练神经网络,就是调整这295个参数,使其对于样本数据,能够让“损失”达到最小。再次回顾二次损失函数的定义(其中n=295):

B-O-F-2 损失函数

接着,套用随机梯度下降算法,调整每个参数(以前两个为例):

B-O-F-6 参数的增量

至此,只要求取每个参数对损失函数的偏导数,代入上式即可对参数进行1次优化。可是我们已经知道:神经网络可以近似任意的函数,但却无法知道其代表的函数的确切形式是什么。也就是说,对已知函数求偏导的公式算法,根本用不上。

反向传播

从二十世纪40、50年代人工神经元被发明,那一堆首尾相接的神经元沉寂了长达三十年的漫漫长夜。直到1986年,心理学家David Rumelhart,在深度学习的守护者Geoffrey E. Hinton等人的协助下发现了“反向传播”终极大法,它们就要“活”起来了。

本篇的最后,贴出大法秘诀一饱眼福:

BP1
BP2
BP3
BP4

它由四个基本公式构成,就像所有真理的数学描述一样简洁。仔细看最后两个公式,那不就是损失函数关于神经网络的参数(权值和偏置)的偏导数的表达式吗?而这就是反向传播的核心目的,有了它梯度下降算法就能run起来了。

原文发布于微信公众号 - 人工智能LeadAI(atleadai)

原文发表时间:2017-08-19

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏翻译外文

数据、学习和模型

机器学习中有几个关键的概念,这些概念为理解机器学习这个领域奠定了基础。

1809
来自专栏Pytorch实践

Pytorch实现LSTM时间序列预测

摘要:本文主要基于Pytorch深度学习框架,实现LSTM神经网络模型,用于时间序列的预测。 开发环境说明: Python 35 Pytorch 0.2 CP...

6707
来自专栏开心的学习之路

神经网络体系搭建(二)——深度学习网络

本篇是神经网络体系搭建的第二篇,解决体系搭建的深度学习网络相关问题,详见神经网络体系搭建(序) 深度学习是一个已经被说烂了的词,几乎说起人工智能,非专业人士也会...

34610
来自专栏大数据文摘

斯坦福深度学习课程第三弹:神经网络与反向传播

22313
来自专栏大数据挖掘DT机器学习

机器学习-R-特征选择

特征选择是实用机器学习的重要一步,一般数据集都带有太多的特征用于模型构建,如何找出有用特征是值得关注的内容。 1. Feature selection: Al...

3878
来自专栏AI科技大本营的专栏

阿里团队最新实践:如何解决大规模分类问题?

【AI科技大本营导读】近年来,深度学习已成为机器学习社区的一个主要研究领域。其中一个主要挑战是这种深层网络模型的结构通常很复杂。对于一般的多类别分类任务,所需的...

611
来自专栏机器学习和数学

[高大上的DL] Deep Learning中常用loss function损失函数的小结

在前面我们分享的如何来训练CNN中,提到了BP算法,还记得BP算法是怎么更新参数w,b的吗?当我们给网络一个输入,乘以w的初值,然后经过激活函数得到一个输出。然...

6098
来自专栏null的专栏

机器学习中的特征——特征选择的方法以及注意点

关于机器学习中的特征我有话要说     在这次校园招聘的过程中,我学到了很多的东西,也纠正了我之前的算法至上的思想,尤其是面试百度的过程中,让我渐渐意识到机器学...

2729
来自专栏奇点大数据

机器学习必备的数学基础有哪些?

对于机器学习给出了这样一个定义,机器学习是由三个部分组成,分别是表示、评价,还有优化。这样的三个步骤,实际上也就对应着在机器学习当中所需要的数学。

602
来自专栏机器学习算法与Python学习

循环神经网络(RNN)

前言: 前馈神经网络的输入和输出的维数都是固定的,不能任意改变。当处理序列数据时,前馈神经网络就无能力为了。因为序列数据是变长的。为了使得前馈神经网络能处理变长...

2706

扫描关注云+社区