学界 | 为什么数据科学家都钟情于最常见的正态分布?

大数据文摘出品

编译:JonyKai、元元、云舟

对于深度学习和机器学习工程师们来说,正态分布是世界上所有概率模型中最重要的一个。即使你没有参与过任何人工智能项目,也一定遇到过高斯模型,今天就让我们来看看高斯过程为什么这么受欢迎。

高斯分布(Gaussian distribution),也称正态分布,最早由A.棣莫弗在求二项分布的渐近公式中得到。C.F.高斯在研究测量误差时从另一个角度导出了它。P.S.拉普拉斯和高斯研究了它的性质。是一个在数学、物理及工程等领域都非常重要的概率分布,在统计学的许多方面有着重大的影响力。

正态曲线呈钟型,两头低,中间高,左右对称因其曲线呈钟形,因此人们又经常称之为钟形曲线。

若随机变量X服从一个数学期望为μ、方差为σ^2的正态分布,记为N(μ,σ^2)。其概率密度函数为正态分布的期望值μ决定了其位置,其标准差σ决定了分布的幅度。当μ = 0,σ = 1时的正态分布是标准正态分布。

高斯概率分布的数学表达式

在自然现象中随处可见

所有模型都是错的,但有些是有用的 —George Box

正在扩散的粒子的位置可以用正态分布来描述

正态分布有极其广泛的实际背景,生产与科学实验中很多随机变量的概率分布都可以近似地用正态分布来描述。例如,在生产条件不变的情况下,产品的强力、抗压强度、口径、长度等指标;同一种生物体的身长、体重等指标;同一种种子的重量;测量同一物体的误差;弹着点沿某一方向的偏差;某个地区的年降水量;以及理想气体分子的速度分量,等等。

一般来说,如果一个量是由许多微小的独立随机因素影响的结果,那么就可以认为这个量具有正态分布。从理论上看,正态分布具有很多良好的性质,许多概率分布可以用它来近似;还有一些常用的概率分布是由它直接导出的,例如对数正态分布、t分布、F分布等。

数学原因:中心极限定理

二维空间上进行200万步的随机游走之后得到的图案

中心极限定理的内容为:大量独立随机变量的和经过适当标准化之后趋近于正态分布,与这些变量原本的分布无关。比如,随机游走的总距离就趋近于正态分布。下面我们介绍三种形式的中心极限定理:

独立同分布的中心极限定理

设随机变量X1,X2,......Xn,......独立同分布,并且具有有限的数学期望和方差:E(Xi)=μ,D(Xi)=σ^2 (i=1,2....),则对任意x,分布函数为

满足

该定理说明,当n很大时,随机变量

近似地服从标准正态分布N(0,1)。因此,当n很大时,

近似地服从正态分布N(nμ,nσ^2).该定理是中心极限定理最简单又最常用的一种形式,在实际工作中,只要n足够大,便可以把独立同分布的随机变量之和当作正态变量。这种方法在数理统计中用得很普遍,当处理大样本时,它是重要工具。

棣莫佛-拉普拉斯定理

设随机变量X(n=1,2,...,)服从参数为n,p(0<p<1)的二项分布,则对于任意有限区间(a,b)有

该定理表明,正态分布是二项分布的极限分布,当数充分大时,我们可以利用上式来计算二项分布的概率。

不同分布的中心极限定理

设随机变量X1,X2,......Xn,......独立同分布,它们的概率密度分别为fxk(x),并有E(Xk)=μk,D(Xk)= σk^2,(k=1,2......)

若对任意正数τ,有:

对任意x,随机变量Yn的分布函数Fn(x),满足:

该定理说明:所研究的随机变量如果是有大量独立的而且均匀的随机变量相加而成,那么它的分布将近似于正态分布。

万变不离其宗

与其他很多分布不同,正态分布进行适当的变换之后,仍是正态分布。

  • 两个正态分布之积仍是正态分布
  • 两个独立的服从正态分布的随机变量之和服从正态分布
  • 对一个正态分布进行高斯卷积还是正态分布
  • 正态分布经过傅立叶变换之后仍是正态分布

简洁

奥卡姆剃刀强调一个哲学原则:在其他条件都相同下,最简单的解就是最好的解。

对于任何一个用正态分布拟合的随机分布,都可能存在一个多参数,更复杂,更准确的解法。但是我们仍然会倾向于选用正态分布,因为它在数学上很简洁。

  • 它的均值(mean)、中值(median)和众数(mode)都相同
  • 只需要用两个参数就可以确定整个分布

图形特性:

  • 集中性:正态曲线的高峰位于正中央,即均数所在的位置。
  • 对称性:正态曲线以均数为中心,左右对称,曲线两端永远不与横轴相交。
  • 均匀变动性:正态曲线由均数所在处开始,分别向左右两侧逐渐均匀下降。
  • 曲线与横轴间的面积总等于1,相当于概率密度函数的函数从正无穷到负无穷积分的概率为1。即频率的总和为100%。

相关报道:

https://towardsdatascience.com/why-data-scientists-love-gaussian-6e7a7b726859

原文发布于微信公众号 - 大数据文摘(BigDataDigest)

原文发表时间:2018-06-18

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏数据结构与算法

正态分布与中心极限定理

也就是说,正态分布一种分布形式,它实际上有很多表示形式,最常见的有概率密度函数,累计分布函数等等来表示。

1251
来自专栏前沿技墅

“机器学习”三重门,“中庸之道”趋若人

博士毕业于电子科技大学,美国西北大学访问学者,现执教于河南工业大学。中国计算机协会(CCF)会员,CCF YOCSEF郑州2018—2019年度副主席,ACM/...

1294
来自专栏上善若水

0x01机器学习简史

about 全面介绍机器学习的发展史,从感知机、神经网络、决策树、SVM、Adaboost到随机森林、Deep Learning。

1096
来自专栏人工智能

掌握机器学习数学基础之概率统计(二)

标题: 机器学习为什么要使用概率 概率学派和贝叶斯学派 何为随机变量和何又为概率分布? 条件概率,联合概率和全概率公式: 边缘概率 独立性和条件独立性 期望、方...

2055
来自专栏数学人生

深度学习与强化学习

随着 DeepMind 公司的崛起,深度学习和强化学习已经成为了人工智能领域的热门研究方向。除了众所周知的 AlphaGo 之外,DeepMind 之前已经使用...

8311
来自专栏达观数据

深度学习技术如何应用于文本智能处理?

2362
来自专栏AI科技评论

观点 | 中科院自动化所赫然:大规模人脸图像编辑理论、方法及应用

AI 科技评论按:2018 年 4 月 14 日-15 日,中国图象图形学学会围绕「生物特征识别」这一主题,在中科院自动化所举办第四期「CSIG 图像图形学科前...

1223
来自专栏机器学习算法与Python学习

文本嵌入的经典模型与最新进展(下载PDF)

1963
来自专栏数据科学与人工智能

【算法】神经网络和深度学习简介

深度学习掀起海啸 如今,深度学习浪潮拍打计算机语言的海岸已有好几年,但是,2015年似乎才是这场海啸全力冲击自然语言处理(NLP)会议的一年。——Dr. Chr...

3787
来自专栏AI科技大本营的专栏

时下火热的wGAN将变革深度学习?这得从源头讲起

随着柯洁与AlphaGo结束以后,大家是不是对人工智能的底层奥秘越来越有兴趣? 深度学习已经在图像分类、检测等诸多领域取得了突破性的成绩。但是它也存在一些问题。...

35111

扫码关注云+社区