数据科学家所需的技能和素质

对数据科学家的关注,源于大家逐步认识到,Google、Amazon、Facebook等公司成功的背后,存在着这样的一批专业人才。这些互联网 公司对于大量数据不是仅进行存储而已,而是将其变为有价值的金矿——例如,搜索结果、定向广告、准确的商品推荐、可能认识的好友列表等。

数据科学(datascience)是一个很久之前就存在的词汇,但数据科学家(datascientist)却是几年前突然出现的一个新词。关于 这个词的起源说法不一,其中在《数据之美》(BeautifulData,TobySegaran、JeffHammerbacher编 著,O’Reilly出版1)一书中,对于Facebook的数据科学家,有如下叙述:在Facebook,我们发现传统的头衔如商业分析师、统计学家、 工程师和研究科学家都不能确切地定义我们团队的角色。该角色的工作是变化多样的:在任意给定的一天,团队的一个成员可以用Python实现一个多阶段的处 理管道流、设计假设检验、用工具R在数据样本上执行回归测试、在hadoop上为数据密集型产品或服务设计和实现算法,或者把我们分析的结果以清晰简洁的 方式展示给企业的其他成员。为了掌握完成这多方面任务需要的技术,我们创造了‘数据科学家’这种角色。”

数据科学家

仅仅在几年前,数据科学家还不是一个正式确定的职业,然而一眨眼的工夫,这个职业就已经被誉为“今后10年IT行业最重要的人才”了。

Google首席经济学家、加州大学伯克利分校教授哈尔·范里安(HalVarian,1947—)先生,在2008年10月与麦肯锡总监 JamesManyika先生的对话中,曾经讲过下面一段话:“我总是说,在未来10年里,最有意思的工作将是统计学家。人们都认为我在开玩笑。但是,过 去谁能想到电脑工程师会成为20世纪90年代最有趣的工作?在未来10年里,获取数据——以便能理解它、处理它、从中提取价值、使其形象化、传送它——的 能力将成为一种极其重要的技能,不仅在专业层面上是这样,而且在教育层面(包括对中小学生、高中生和大学生的教育)也是如此。由于如今我们已真正拥有实质 上免费的和无所不在的数据,因此,与此互补的稀缺要素是理解这些数据并从中提取价值的能力。”

范里安教授在当初的对话中使用的是statisticians(统计学家)一词,虽然当时他没有使用数据科学家这个词,但这里所指的,正是现在我们所讨论的数据科学家。

数据科学家所需的技能

数据科学家这一职业并没有固定的定义,但大体上指的是这样的人才:

“所谓数据科学家,是指运用统计分析、机器学习、分布式处理等技术,从大量数据中提取出对业务有意义的信息,以易懂的形式传达给决策者,并创造出新的数据运用服务的人才。”

数据科学家所需的技能如下。

(1)计算机科学

一般来说,数据科学家大多要求具备编程、计算机科学相关的专业背景。简单来说,就是对处理大数据所必需的Hadoop、Mahout等大规模并行处理技术与机器学习相关的技能。

(2)数学、统计、数据挖掘等

除了数学、统计方面的素养之外,还需要具备使用SPSS、Sas等主流统计分析软件的技能。其中,面向统计分析的开源编程语言及其运行环境R最近备 受瞩目。R的强项不仅在于其包含了丰富的统计分析库,而且具备将结果进行可视化的高品质图表生成功能,并可以通过简单的命令来运行。此外,它还具备称为 CRAN(TheComprehensiveRArchiveNetwork)的包扩展机制,通过导入扩展包就可以使用标准状态下所不支持的函数和数据 集。

(3)数据可视化(Visualization)

信息的质量很大程度上依赖于其表达方式。对数字罗列所组成的数据中所包含的意义进行分析,开发Web原型,使用外部API将图表、地图、Dashboard等其他服务统一起来,从而使分析结果可视化,这是对于数据科学家来说十分重要的技能之一。

将数据与设计相结合,让晦涩难懂的信息以易懂的形式进行图形化展现的信息图(Infographics)最近正受到越来越多的关注,这也是数据可视化的手法之一。

作为参考,下面节选了Facebook和Twitter的数据科学家招聘启事。对于现实中的企业需要怎样的技能,这则启事应该可以为大家提供一些更实际的体会。

Facebook招聘数据科学家

Facebook计划为数据科学团队招聘数据科学家。应聘该岗位的人,将担任软件工程师、量化研究员的工作。理想的候选人应对在线社交网络的研究有浓厚兴趣,能够找出创造最佳产品过程中所遇到的课题,并对解决这些课题拥有热情。

职务内容

确定重要的产品课题,并与产品工程团队密切合作寻求解决方案

通过对数据运用合适的统计技术来解决课题

将结论传达给产品经理和工程师

推进新数据的收集以及对现有数据源的改良

对产品的实验结果进行分析和解读

找到测量、实验的最佳实践方法,传达给产品工程团队

必要条件

相关技术领域的硕士或博士学位,或者具备4年以上相关工作经验

对使用定量手段解决分析性课题拥有丰富的经验

能够轻松操作和分析来自各方的、复杂且大量的多维数据

对实证性研究以及解决数据相关的难题拥有极大的热情

能对各种精度级别的结果采用灵活的分析手段

具备以实际、准确且可行的方法传达复杂定量分析的能力

至少熟练掌握一种脚本语言,如Python、PHP等精通关系型数据库和SQL

对R、Matlab、SAS等分析工具具备专业知识

具备处理大量数据集的经验,以及使用MapReduce、Hadoop、Hive等分布式计算工具的经验

Twitter招聘数据科学家(负责增加用户数量)

关于业务内容

Twitter计划招聘能够为增加Twitter用户数提供信息和方向、具备行动力和高超技能的人才。应聘者需要具备统计和建模方面的专业背景,以及大规模数据集处理方面的丰富经验。

我们期待应聘者所具有的判断力能够在多个层面上决定Twitter产品群的方向。

职责

使用Hadoop、Pig编写MapReduce格式的数据分析

能够针对临时数据挖掘流程和标准数据挖掘流程编写复杂的SQL查询

能够使用SQL、Pig、脚本语言、统计软件包编写代码

以口头及书面形式对分析结果进行总结并做出报告

每天对数TB规模、10亿条以上事务级别的大规模结构化及非结构化数据进行处理

必要条件

计算机科学、数学、统计学的硕士学位或者同等的经验

2年以上数据分析经验

大规模数据集及Hadoop等MapReduce架构方面的经验

脚本语言及正则表达式等方面的经验

对离散数学、统计、概率方面感兴趣

将业务需求映射到工程系统方面的经验

数据科学家所需的素质

(1)沟通能力

即便从大数据中得到了有用的信息,但如果无法将其在业务上实现的话,其价值就会大打折扣。为此,面对缺乏数据分析知识的业务部门员工以及经营管理层,将数据分析的结果有效传达给他们的能力是非常重要的。

(2)创业精神(entrepreneuership)

以世界上尚不存在的数据为中心创造新型服务的创业精神,也是数据科学家所必需的一个重要素质。Google、Amazon、Facebook等通过数据催生出新型服务的企业,都是通过对庞大的数据到底能创造出怎样的服务进行艰苦的探索才获得成功的。

(3)好奇心

庞大的数据背后到底隐藏着什么,要找出答案需要很强的好奇心。除此之外,成功的数据科学家都有一个共同点,即并非局限于艺术、技术、医疗、自然科学 等特定领域,而是对各个领域都拥有旺盛的好奇心。通过对不同领域数据的整合和分析,就有可能发现以前从未发现过的有价值的观点。

美国的数据科学家大多拥有丰富的从业经历,如实验物理学家、计算机化学家、海洋学家,甚至是神经外科医生等。也许有人认为这是人才流动性高的美国所 特有的现象,在日本也出现了一些积极招募不同职业背景人才的企业,这样的局面距离我们已经不再遥远。

原文发布于微信公众号 - PPV课数据科学社区(ppvke123)

原文发表时间:2014-02-12

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏大数据挖掘DT机器学习

数据科学家需要怎样的技能组合?

原文:http://developer.51cto.com/art/201604/508969.htm 在2016年的美国,数据科学家已经被冠以“最佳工作”的头...

36360
来自专栏MixLab科技+设计实验室

写给设计师的人工智能指南:虚拟私人助理

本期谈谈 《虚拟私人助理》相关的内容。 我们先大致看下人工智能10大细分行业的典型应用: 1、深度学习/机器学习: 预测数据模型与分析数据的软件平台; 垃圾邮件...

44060
来自专栏CDA数据分析师

数据分析师的自我修养丨如何进阶为数据科学家

关于如何进入数据科学领域的文章有很多,但是关于从数据分析师转变为数据科学家的文章却很少。

17930
来自专栏大数据文摘

大咖 | Teradata CTO谈数据分析的未来:大数据或消失,公民数据科学家很危险

当地时间10月15日,2018 Teradata全球用户大会在美国拉斯维加斯举行。来自15个国家的3000多位数据人参与了本次峰会。

8720
来自专栏场景录小程序

干货丨矩阵化运营,轻松提高小程序流量

目前很多头部小程序都在发展小程序矩阵化,因为单一的小程序无法形成生态,不利于长时间发展。而做矩阵的目的不只是实现精准的流量获取,更重要的一点是为了实现目标人群一...

13220
来自专栏数据的力量

【干货】腾讯10年用户体验设计的核心方法

16830
来自专栏灯塔大数据

每周学点大数据 | No.1何谓大数据

No.1期 带你认识大数据 咚咚咚。 一天下午,王老师的门被敲响了。 Mr. 王:请进。 门被轻轻地推开了,随后被有礼貌地关上了。 Mr. 王:你就是小可吧?...

383140
来自专栏云市场·精选汇

干货丨矩阵化运营,轻松提高小程序流量

目前很多头部小程序都在发展小程序矩阵化,因为单一的小程序无法形成生态,不利于长时间发展。而做矩阵的目的不只是实现精准的流量获取,更重要的一点是为了实现目标人群一...

16920
来自专栏PPV课数据科学社区

【热点】从底层到应用,那些数据人的必备技能

作者简介 潘鹏举,携程酒店研发部 BI 经理,负责酒店服务相关的业务建模工作,主要方向是用机器学习帮助业务创造价值。本文首发作者知乎,略有修改,点击底部“阅读原...

38070
来自专栏PPV课数据科学社区

AI时代就业指南:Java 程序员如何转行做大数据?

随着大数据的爆发,中国IT业内环境也将面临新一轮的洗牌,不仅是企业,更是从业人员转型可遇而不可求的机遇。如果将IT人士统一比作一条船上的海员,大数据...

40780

扫码关注云+社区

领取腾讯云代金券