如何学习数据科学

本文翻译自一篇博客文章,作者是一名软件工程师,他描述了在五年时间内学习数据科学的经历和心得,他的学习途径包括了自学(书籍、博客、小项目),课程学习,教学讨论,会议交流和工作实践。

一、入门

1)自学(2 - 4个月)

自学是起步的关键。两年前,我和几个同事组成了一个研究小组,讨论统计202课程的学习材料。这让我感觉很兴奋,并由此开始数据分析的学习研究。研究小组有5名成员,但最后只有2个人选择去更深入地研究这个领域(数据科学并不适合每一个人)。

学习基本的统计知识:统计202课程是非常合适的入门资料

学习一种统计工具:作为一个菜鸟,我用了3个月的时间埋头学习R语言,R学起来非常有趣。(为什么要学习R?)

解决一些好玩的小问题:好奇心是数据科学的关键。如果你对国家的经济问题,犯罪统计,体育成绩等感兴趣的话,去收集数据并开始回答你的问题吧。

学习Unix工具:我选择了O'Reilly出版的数据之魅作为学习材料。

学习SQL和脚本语言:我了解的有Java,Ruby和SQL。 Python也在我的名单上。

有很多的培训材料可以在网上找到:

统计202

加州理工学院的数据科学课程

Coursera:数据科学,机器学习,数据分析,数据分析计算

加州大学伯克利分校 - 数据科学

骑士新闻中心的课程:资讯图像和数据可视化

统计101:Udacity(统计入门),可汗学院,卡耐基梅隆大学的统计课程

Learn R

2)课堂训练(9 - 12个月)

如果你想认真提高这项技能,那就选择一门课程,严肃的对待它。斯坦福大学提供了很优秀的课程。

数据挖掘分析STATS202

线性和非线性优化MS&E211

挖掘海量数据集CS246

现代应用统计:STATS315A

统计方法的金融应用STATS240P

现代应用统计:数据挖掘STATS315B

二、聚焦

1)集中所有精力

当我迷上了数据科学时,我发现只花20%的时间是不够的,这需要花100%的时间,所以我会去发现并解决工作中出现的所有和数据相关的问题(大数据分析,医疗保健,零售分析,优化问题)。

2)着手有趣的问题

把学习目标和个人兴趣放在一起。解决有趣的问题,同时学习新的技术是很有用的。例如我对零售,医疗保健和体育数据分析很有兴趣。

3)加速学习:

教学相长:我会给同事和朋友教一些R语言和数据挖掘的入门知识。这使我在这方面的知识更为扎实,也使得周围的人对这个主题更有兴趣。这对我来说也是一种回馈开源社区的方式。博客写作也是另一种学习和贡献的方式。

关注业内领袖:网络中有很多厉害的数据科学家,关注这些人可以得到很好的启发。例如: DJPatil, Hillary Mason,Jeff Hammerbacher, Carla Gentry, Monica Rogati, CathyO'Neil。

阅读有趣的博客:http://datascience101.wordpress.com,http://columbiadatascience.com/blog,http://www.r-bloggers.com,http://www.datawrangling.com,http://flowingdata.com(Quora的最好的的数据博客列表)

定期参加聚会:本地的数据科学/ R聚会,这一领域的发展非常迅速,我至少每隔一年去那里。看看有什么好玩的新东西。

了解大数据技术:MapReduce / Hadoop,云计算。我尽量不使用任何商业技术供应商,现在回想起来,这是一个很好的决定。

4)了解业务领域知识

我很幸运,有机会接触到内部和外部的数据科学家,他们帮助我理解他们处理数据问题的方法。我从他们身上学到的“假设驱动的数据分析”,而不是“盲目加蛮力数据分析”的重要性。重点是理解的业务领域问题,然后再尝试从数据中提取有意义的见解。这使我了解一些运营,零售,旅游及物流收入管理和医疗行业。“纽约时报”近日发表文章,强调有必要为直觉。

3、有用的数据科学读物

数据挖掘导论

果壳中的R

数据之魅

可视化之美

查看更多的数据科学的书籍:O'Reilly,Manning

4、对我感觉没多大用的东西

学习多个统计工具:一年前,我开始有一些SAS编程的工作要求,我学了一个月左右的SAS,但没什么效果。主要的原因是学习惯性,而且我喜欢用R.我真的没有需要去学习另一种统计工具。R虽然不是完美的,但将R和其他我熟悉的软件工具结合,我可以解决所有数据的科学问题。因此,我的建议是,如果你已经知道了SAS,STATA,MATLAB,SPSS,STATISTICA,非常好,坚持下去。但是,如果你正在学习一种新的统计工具,那就选择R吧。

公开课程:我试图用Coursera来自定进度学习,但对我来说,这不是有效的。我需要有压力,有学分的正式课程。

过多的学习量:需要注意工作与生活的平衡。今年早些时候,我试图同时学习多门困难的课程,我很快就意识到这么干没什么好处。

来源:博客数据科学与R语言

原文发布于微信公众号 - 数据的力量(shujudeliliang)

原文发表时间:2014-11-25

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏CDA数据分析师

猎聘网单艺:数据分析师的9大挑战

报告正文: 大家好,我是来自猎聘网的单艺,很高兴今天下午能够有机会跟大家聊一聊我们做数据分析在这个大数据时代会面临的哪些机会和挑战。我演讲的主题是数据分析师的十...

2646
来自专栏人称T客

集团ERP研究:实施能力国产厂商有优势 SAP并非无懈可击

产品实施是ERP行业一直以来避讳的话题,无论售前讲的天花乱坠,最终实施才是见真章的时候,考验产品质量、团队技术能力、实施人员专业度和灵活度在这一环节高下立见,许...

2829
来自专栏PPV课数据科学社区

都在说“大数据”,那它到底能帮企业什么忙?

大数据对企业来说有什么用?对于这个连IT界都众说纷纭的事情,要让希望使用大数据产品和服务的企业主们来说,更是一头雾水。其实,从传统企业的运行流程来看,大数据主要...

2735
来自专栏镁客网

阿里巴巴与三个知名车企达成合作,将为其“AI+车”解决方案 | 热点

1324
来自专栏PPV课数据科学社区

【学习】数据分析与数据挖掘类的职位必备技能

大数据催生数据分析师 薪酬比同等级职位高20% 随着大数据在国内的发展,大数据相关人才却出现了供不应求的状况,大数据分析师更是被媒体称为“未来最具发...

3626
来自专栏灯塔大数据

荐读|浅谈电信运营商的大数据应用探索

如《大数据时代》作者迈尔-舍恩伯格所说,“大数据开启了一次重大的时代转型。大数据正在改变我们的生活以及理解世界的方式,成为新发明和新服务的源泉,而更多的改变正...

2868
来自专栏数据的力量

高级运营和普通运营的区别

1635
来自专栏新智元

贝索斯:AI 是亚马逊成功的秘密燃料,承诺机器学习将带来更多

【新智元导读】Amazon 首席执行官 Jeff Bezos 在最新公开的年度致股东信中表示,Amazon 正在拥抱人工智能,从看得到的无人机送货、智能音箱 E...

3575
来自专栏悦思悦读

微信公众号,真的有必要运营吗?

3593
来自专栏架构师小秘圈

程序员、架构师、技术经理、技术总监和CTO都是干什么的?

程序员   程序员,英文名coder/programmer,大家常自嘲叫码农的阶段。这个角色职责是把需求或产品实现为用户可用的软件产品。   此职位为执行级别...

4374

扫码关注云+社区