前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >给大数据入门小伙伴的几个小挑战No.28

给大数据入门小伙伴的几个小挑战No.28

作者头像
大蕉
发布2018-02-05 17:38:38
5370
发布2018-02-05 17:38:38
举报

我是小蕉。

子曰:视其所以,观其所由,察其所安,人焉廋哉?人焉廋哉?

子曰:不患无位,患所以立;不患莫己知,求为可知也。


今天突然神来之笔,有小伙伴说想入门大数据但是苦于还是不知道怎么入手,或者说没有东西练手。

好,那就直接跟你们分享几个小任务,我相信你要是用心去做,用心去理解有什么解决方案,背后的运行逻辑,你至少可以把大数据入个门,这几个任务为期两个月,具体时间分配自己把握。

敲黑板!!!

我不会提供任何的源码,也不会提供任何方案,但是可以提供咨询。

(当然一切问题小伙伴们还是先问度娘,因为只要是能度娘的问题,我全部都会直接回复:问度娘。)

任务一:环境搭建

自己开虚拟机或者云主机搭好Hadoop,Spark,Hive,sqoop,原生的那种。

注意事项:版本搭配要合理,不然会有很多坑。

任务二、数据准备

使用Spark生成500万数据,包含[身份证,手机号,日期]三个字段。其中身份证格式为18位,手机号为6位,日期为yyyy-mm-dd,手机号其中有100万必须为10086,都必须为合理的随机数据,不能是序列,结果保存到Hive表中。

注意事项:版本搭配要合理,不然会有很多坑。

任务三、MapReduce初探

使用任务二的数据进行关系生成,相同手机号的人认为有关系。过滤空数据以及6位号码相同的,若发现同一号码导致的关系数超过3000,剔除,结果保存到Hive中。

注意事项:注意考虑数据倾斜是怎么被解决的。

任务四、内存调优及算法实现

利用任务三生成的关系,利用GraphX和SLPA进行社区划分。

注意事项:SLPA需要自己实现,要思考GraphX的局限性。


完成了的小伙伴可以后台告诉我,也可以每天跟我互动进展。

很好玩的,肯定会会遇到很多很多的问题,也可以增进对Hadoop这一套东西的理解。

周末又过去了,小蕉除了看了点书看了点视频做了个PPT啥也没干。

要谢谢大家的支持~读者马上要破300啦~

虽然读者也不多,表达能力也不过关,没能给更多的读者带来帮助,但是呢,也是小小的激动,毕竟也写了四个多月啦,谢谢大家支持,喜欢的小伙伴呢,也可以分享给小伙伴,不然写起来很没劲吖~~

昨天的PPT放出来目录后还是收到了很多的建议,但是现在还没做好,所以暂时应该还不会放出来,相信到时候对大家理解机器学习这个东西和如何入门应该会有不小的帮助。

读着《数学之美》,越看越觉得数学在我们生活中的应用真的太被小看了,很多事情的解决方案,都可以从数学的角度来看待。可能大家经过了高中的教育后,对于天体,以及电子中的数学都比较熟悉了,但是对于语言、图论、密码学、信息噪音、搜索等领域的数学可能都是一片浆糊。

书中不断提及的一点:简单有效的方法,可能不是最准确的,但一定是最好用的。

也在同时看着《论语》,当然是有翻译那种,每次读都能读到一些之前可能不太想得到的东西,当然也有的东西过于极端化。嘛,每个人价值观都不一样嘛。

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2017-07-16,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 一名叫大蕉的程序员 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
大数据
全栈大数据产品,面向海量数据场景,帮助您 “智理无数,心中有数”!
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档