专栏首页CDA数据分析师Google首席决策师告诉你数据科学究竟是什么?

Google首席决策师告诉你数据科学究竟是什么?

作者: Cassie Kozyrkov

编译: Mika 本文为 CDA 数据分析师原创作品,转载需授权

关于作者: Cassie Kozyrkov,Google首席决策师。致力于统计学, 机器学习 /人工智能、数据、决策科学。

数据科学是让数据变得有用的学科。在本文中我将对数据科学中以下三个概念进行解读:

  • 统计
  • 机器学习
  • 数据挖掘/分析

1. 定义数据科学

看到数据科学这个术语的早期历史,你会发现当时有两个概念是密不可分的。

  • 大数据意味着要更多地利用计算机
  • 统计学很难把纸上的算法通过计算机实现

因此,数据科学诞生了。最开始数据科学家的的定义是“能够编程的统计学家”。如今看来,这个说法并不准确,但首先让我们看到数据科学本身。

2003年的数据科学期刊中曾提出:“‘数据科学’意味着任何与数据有关的内容”。我很同意这个观点,现在一切都离不开数据。

之后,我们看到了很多不同的观点,比如Conway的维恩图(下图),以及Mason和Wiggins的经典观点。

Drew Conway对数据科学的定义

我个人更喜欢维基百科上的定义:

数据科学是“结合了统计、数据分析、机器学习及其相关方法的概念”,以便用数据“理解和分析实际现象”。

这有些复杂了,让我们精简一下,即:

“数据科学是让数据有用的学科。”

你现在可能会想,但这也太精简了,“有用”这个词怎么能囊括所有这些术语呢?

那么让我们先看到下面的图。

统计学家和机器学习工程师之间的区别,并不是前者使用R语言而后者使用Python。由于许多原因,用SQL、R、Python进行分类是不明智的,如今你甚至可以用SQL进行机器学习。

新手还喜欢通过算法进行区分,许多大学课程也是这么安排的,这也是不明智的。最好不要用直方图、t检验以及神经网络进行分类。坦率地说,如果你很聪明,其实你可以用相同的算法解决任何数据科学问题。

我建议可以这样进行区分:

这指的是什么呢?当然是决定。你可以根据所需的事实,通过描述性分析得出决策。

我们的行动和决定会影响周围的世界。我们之前谈到要让数据变得有用,而这与现实世界的行动是紧密相关的。

以下是决策导向图,完成这三点能够让数据变得有用。

2. 数据挖掘

如果你不知道想做出什么样的决定,那么最好的做法就是去寻找灵感。这就称为数据挖掘、数据分析、描述性分析、探索性数据分析或(EDA)或知识发现(KD)。

分析的黄金法则:只对你所看到的做出结论。

你可以将数据集想象为在暗室中发现的一堆底片。数据挖掘就是让设备尽快曝光这些照片,看是否能从中得出启发。数据挖掘的黄金法则是:只能对你能看到的做出结论,不要对你看不到的内容做出判断,因为你需要统计数据等更多的专业知识。

数据挖掘的专业知识取决于检查数据的速度。一开始暗房会令人生畏,但其实也没什么大不了的,只是学会使用设备就行了。当你开始乐在其中时,你就可以称为数据分析师了;当你能够飞速地曝光照片时,你就可以称为分析师专家了。

3. 统计推断

灵感很容易获得,但严谨来之不易。如果你想重复利用数据,那么则需要专业的培训。作为本科和硕士都学统计学专业的人,我认为统计推断(简称统计)是三个领域中最难且最具哲学内涵的。想学好统计需要花费大量时间。

如果你打算做出高质量、风险可控的重要决策,那么你需要在分析团队中加入统计技能。在不确定的情况下,统计学是能改变你想法的学科。

4. 机器学习

机器学习实质上是使用例子而不是指令来实现操作。关于机器学习我曾写过一些文章,如关于机器学习与AI 的区别;如何入门机器学习等,如果感兴趣的话可以看看。

  • The simplest explanation of machine learning you’ll ever read https://hackernoon.com/the-simplest-explanation-of-machine-learning-youll-ever-read-bebc0700047c
  • Are you using the term 'AI' incorrectly? https://medium.com/@kozyrkov/are-you-using-the-term-ai-incorrectly-911ac23ab4f5
  • Why businesses fail at machine learning https://hackernoon.com/why-businesses-fail-at-machine-learning-fbff41c4d5db

5. 数据工程

那么数据工程是什么呢?数据工程指的是为数据科学团队提供数据的工作。数据工程本身就是一个复杂的领域,它更接近软件工程,而不是统计学。

数据工程和数据科学之间的差异是前后的区别。获取数据前的大部分技术工作都可以简单地称为“数据工程”,而得到数据后我们所做的一切都是“数据科学”。

6. 决策智能

决策智能是关于决策的,包括对根据大量数据进行决策,因此这也使其成为一个工程学科。它利用社会和管理科学的理念,增强数据科学的应用。

决策智能是社会和管理科学的组成部分。换而言之,它是数据科学的超集,而不涉及为通用用途创建基本方法之类的研究工作。

原文链接: https://hackernoon.com/what-on-earth-is-data-science-eb1237d8cb37

本文分享自微信公众号 - CDA数据分析师(cdacdacda),作者:Cassie Kozyrkov

原文出处及转载信息见文内详细说明,如有侵权,请联系 yunjia_community@tencent.com 删除。

原始发表时间:2018-08-28

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

我来说两句

0 条评论
登录 后参与评论

相关文章

  • 分析了10个垂直行业后,告诉你大数据应用面临哪些挑战

    本文转自网络,如涉侵权请及时联系我们 大数据已经成为过去几年中大部分行业的游戏规则,行业领袖,学者和其他知名的利益相关者都同意这一点, 随着大数据继续渗透到我们...

    CDA数据分析师
  • 大数据:千万个“路人甲”的价值逻辑

    【摘要】作为一个生活平淡的人,你是否设想过在完成了某一天的无聊工作后,会在自家的厨房里听到警察的敲门声,然后被告知你可能跟一周后即将发生的一起凶杀案件相关? ...

    CDA数据分析师
  • 从执行到专家:数据分析师的职业层级划分

    1、数据跟踪员:机械拷贝看到的数据,很少处理数据 虽然这个工作的人还不能称作数据分析师,但是往往作这样工作的人还都自称是数据分析师,这样的人,只能通过×××系...

    CDA数据分析师
  • 如何成为一名数据科学家

    用户1737318
  • 如何成为一名数据科学家

    本文是出自Springboard上面一篇文章的摘录,介绍了如果想成为一名数据科学家,需要掌握哪些技能,熟练使用哪些工具,以及如何对数据进行处理等。 ? 数据科学...

    CSDN技术头条
  • 分析了10个垂直行业后,告诉你大数据应用面临哪些挑战

    本文转自网络,如涉侵权请及时联系我们 大数据已经成为过去几年中大部分行业的游戏规则,行业领袖,学者和其他知名的利益相关者都同意这一点, 随着大数据继续渗透到我们...

    CDA数据分析师
  • 数据科学中的强大思维

    人类擅长在所有的事物中寻找对应的模式。真模式,假模式,命名的模式。我们是那种能在薯片上找到猫王的脸的生物。如果你倾向于将模式与洞察力等同起来,请记住有三种数据模...

    AiTechYun
  • 深耕数据挖掘,实现互联互通,在银行风控管理中 ,我国大数据技术应用举足轻重 | 大咖周语录

    当前,大数据已成为科技、经济、社会等各领域的关注焦点。在我国,80%的数据掌握在政府手中,如何激活政府数据,通过数据资产运营进行数据价值激活,将成为支撑国家大数...

    数据猿
  • 数据分析:数据采集是根基

    数据传输,指的是数据以何种方式流入到存储介质,比如日志是通过logstash还是filebeat采集到kafka的,前端的操作记录是通过http请求发送的

    kk大数据
  • 大数据应用:10大行业应用痛点及解决策略

    大数据已经成为这几年中大部分行业的追捧热点,随着大数据继续渗透到我们的日常生活中,围绕大数据的概念热点正在转向实际使用中的真正价值。

    挖掘大数据

扫码关注云+社区

领取腾讯云代金券