数据挖掘历史中的重要里程碑

数据挖掘现在随处可见,而它的故事在《点球成金》出版和“棱镜门”事件发生之前就已经开始了。下文叙述的就是数据挖掘的主要里程碑,历史上的第一次,它是怎样发展以及怎样与数据科学和大数据融合。

数据挖掘是在大数据集(即:大数据)上探索和揭示模式规律的计算过程。它是计算机科学的分支,融合了统计学、数据科学、数据库理论和机器学习等众多技术。

1763 年,Thomas Bayes 的论文在他死后发表,他所提出的 Bayes 理论将当前概率与先验概率联系起来。因为 Bayes 理论能够帮助理解基于概率估计的复杂现况,所以它成为了数据挖掘和概率论的基础。

1805 年, Adrien-Marie Legendre 和 Carl Friedrich Gauss 使用回归确定了天体(彗星和行星)绕行太阳的轨道。回归分析的目标是估计变量之间的关系,在这个例子中采用的方法是最小二乘法。自此,回归成为数据挖掘的重要工具之一。

1936 年,计算机时代即将到来,它让海量数据的收集和处理成为可能。在1936年发表的论文《论可计算数(On Computable Numbers)》中,Alan Turing 介绍了通用机(通用图灵机)的构想,通用机具有像今天的计算机一般的计算能力。现代计算机就是在图灵这一开创性概念上建立起来的。

1943 年,Warren McCullon 和 Walter Pitts 首先构建出神经网络的概念模型。在名为 《A logical calculus of the ideas immanent in nervous activity》 的论文中,他们阐述了网络中神经元的概念。每一个神经元可以做三件事情:接受输入,处理输入和生成输出。

1965 年,Lawrence J. Fogel 成立了一个新的公司,名为 Decision Science, Inc,目的是对进化规划进行应用。这是第一家专门将进化计算应用于解决现实世界问题的公司。

上世纪 70 年代,随着数据库管理系统趋于成熟,存储和查询百万兆字节甚至千万亿字节成为可能。而且,数据仓库允许用户从面向事物处理的思维方式向更注重数据分析的方式进行转变。然而,从这些多维模型的数据仓库中提取复杂深度信息的能力是非常有限的。

1975 年,John Henry Holland 所著的《自然与人工系统中的适应》问世,成为遗传算法领域具有开创意义的著作。这本书讲解了遗传算法领域中的基本知识,阐述理论基础,探索其应用。

到了 80 年代,HNC 对“数据挖掘”这个短语注册了商标。注册这个商标的目的是为了保护名为“数据挖掘工作站”的产品的知识产权。该工作站是一种构建神经网络模型的通用工具,不过现在早已销声匿迹。也正是在这个时期,出现了一些成熟的算法,能够“学习”数据间关系,相关领域的专家能够从中推测出各种数据关系的实际意义。

1989 年,术语“数据库中的知识发现”(KDD)被Gregory Piatetsky-Shapiro 提出。同样这个时期,他合作建立起第一个同样名为KDD的研讨会。

到了 90 年代,“数据挖掘”这个术语出现在数据库社区。零售公司和金融团体使用数据挖掘分析数据和观察趋势以扩大客源,预测利率的波动,股票价格以及顾客需求。

1992 年,Berhard E. Boser, Isabelle M. Guyon 和 Vladimir N. Vanik对原始的支持向量机提出了一种改进办法,新的支持向量机充分考虑到非线性分类器的构建。支持向量机是一种监督学习方法,用分类和回归分析的方法进行数据分析和模式识别式。

1993 年,Gregory Piatetsky-Shapiro 创立“ Knowledge Discovery Nuggets (KDnuggets) ”通讯。本意是联系参加KDD研讨会的研究者,然而KDnuggets.com的读者群现在似乎广泛得多。

2001 年,尽管“数据科学”这个术语在六十年代就已存在,但直至 2001 年,William S. Cleveland 才以一个独立的概念介绍它。根据《Building Data Science Teams》所著,DJ Patil 和 Jeff Hammerbacher 随后使用这个术语介绍他们在 LinkedIn 和 Facebook 中承担的角色 。

2003 年,Micheal Lewis 写的 《点球成金》 出版,同时它也改变了许多主流联赛决策层的工作方式。奥克兰运动家队(美国职业棒球大联盟球队)使用一种统计的,数据驱动的方式针对球员的素质进行筛选,这些球员被低估或者身价更低。以这种方式,他们成功组建了一支打进2002和2003年季后赛的队伍,而他们的薪金总额只有对手的1/3。

如今(2015年),在 2015 年二月,DJ Patil成为白宫第一位首位数据科学家。今天,数据挖掘已经遍布商业、科学、工程和医药,这还只是一小部分。信用卡交易,股票市场流动,国家安全,基因组测序以及临床试验方面的挖掘,都只是指数据挖掘应用的冰山一角。随着数据收集成本变得越来越低,数据收集设备数目激增,像大数据这样的专有名词现在已经是随处可见。

数据挖掘的故事就是这样,匆匆而过!我是否错还过了什么值得提及的事情?我是不是对某些事情叙述的还不够准确?请在下面的评论中让我知道,或者直接邮件联系我。

关于作者myillusion3852:主要兴趣领域为图像处理,模式识别和机器学习方向,希望多与大家交流。

来源:伯乐在线,原文:http://blog.jobbole.com/87420/。

原文发布于微信公众号 - CSDN技术头条(CSDN_Tech)

原文发表时间:2015-06-10

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏AI科技评论

学界 | 只要社会存在偏见,即便是算法操控的机器也无法摘下有色眼镜

AI科技评论按:用网络上现成的语言资料训练机器学习模型已经是现在主流的做法。研究者们希望人工智能从其中学到对人类自然语言的理解,但是人工智能所能学到的内容还远不...

36050
来自专栏PPV课数据科学社区

2017人工智能与机器学习年终盘点(重要工具资源汇总)

2017年是人工智能技术全面开火、勇猛精进的一年,也是对未来全球科技和经济影响深远的一年。 无论人工智能圈子内外的从业者,都开始正视这个可能会很快改变所有人命...

44490
来自专栏大数据文摘

用机器学习的经验指导人生:如何实现学习效率最大化

12630
来自专栏机器之心

观点 | Yoav与LeCun深度学习之争后续:谷歌VP Fernando Pereira谈NLP研究「三幕剧」

选自EarningMyTurns 机器之心编译 参与:机器之心编辑部 近日,著名学者 Yoav Goldberg 发布的一篇批评蒙特利尔大学新论文《Advers...

21660
来自专栏机器之心

OpenAI人工智能1v1击败Dota2最强玩家:明年开启5v5模式

机器之心报道 参与:路雪、李亚洲、黄小天 计算机已经在国际象棋和围棋等经典游戏中打败世界上最厉害的人类。现在又有一台计算机在 Valve 举办的 Dota2 国...

359100
来自专栏罗超频道

忘了黄金时代,理性看待大数据预测

在世界杯预测时准确率超高的百度大数据预测在稳步推进时遇到了一个小障碍,尚处于内测的票房预测对《黄金时代》的预测与实际结果出现了偏差,被媒体长篇报道引发业内高度...

35740
来自专栏专知

走近Hinton:AI教父传奇人生

【导读】Geoffrey Hinton花费了30年的时间默默无闻,直到2012年,他证明了其研究的价值,并驳回了大多数其他科学家所谓的正确观点。如今,这个被称为...

41360
来自专栏新智元

李飞飞:我们怎么教计算机理解图片

前言: 当一个非常小的孩子看到图片时,她可以辨认出里面简单的要素:"猫""书""椅子"。现在,电脑也聪明得可以做同样的工作了。接下来呢?在这个令人震撼的演讲里,...

35480
来自专栏机器之心

人物 | Geoffrey Hinton的成功之路:从神经网络黑暗时代的坚守到今天的胜利

选自The Globe and Mail 作者:Jeff Gary 机器之心编译 参与:吴攀、黄小天、Ellen Han 深度学习泰斗 Geoffrey Hin...

25040
来自专栏华章科技

OpenAI人工智能1v1击败Dota2最强玩家:明年开启5v5模式

在 Dota2 一对一表演赛中,由 OpenAI 设计的 bot 打败了 Danylo "Dendi" Ishutin,一名在职业生涯中已经赢得 735,449...

8040

扫码关注云+社区

领取腾讯云代金券