专栏首页PPV课数据科学社区多图技术贴 | 深入浅出解析大数据平台架构

多图技术贴 | 深入浅出解析大数据平台架构

参加活动赢取话费和一个月免费会员

点击底部阅读原文,参加PPV课玩转可视化图表,赢取话费和PPV课一个月免费会员,精品课程免费看!

目录:

  • 什么是大数据
  • Hadoop介绍-HDFS、MR、Hbase
  • 大数据平台应用举例-腾讯
  • 公司的大数据平台架构

“就像望远镜让我们能够感受宇宙,显微镜让我们能够观测微生物一样,大数据正在改变我们的生活以及理解世界的方式……”。

大数据的4V特征-来源

公司的“大数据”

随着公司业务的增长,大量和流程、规则相关的非结构化数据也爆发式增长。比如:

1、业务系统现在平均每天存储20万张图片,磁盘空间每天消耗100G;

2、平均每天产生签约视频文件6000个,每个平均250M,磁盘空间每天消耗1T

三国里的“大数据”

“草船借箭”和大数据有什么关系呢?对天象的观察是基于一种对风、云、温度、湿度、光照和所处节气的综合分析这些数据来源于多元化的“非结构”类型,并且数据量较大,只不过这些数据输入到的不是电脑,而是人脑并最终通过计算分析得出结论。

Google分布式计算的三驾马车

  • Google File System用来解决数据存储的问题,采用N多台廉价的电脑,使用冗余(也就是一份文件保存多份在不同的电脑之上)的方式,来取得读写速度与数据安全并存的结果。
  • Map-Reduce说穿了就是函数式编程,把所有的操作都分成两类,map与reduce,map用来将数据分成多份,分开处理,reduce将处理后的结果进行归并,得到最终的结果。
  • BigTable是在分布式系统上存储结构化数据的一个解决方案,解决了巨大的Table的管理、负载均衡的问题。

Hadoop体系架构

Hadoop核心设计

HDFS介绍-文件读流程

Client向NameNode发起文件读取的请求。

NameNode返回文件存储的DataNode的信息。

Client读取文件信息。

HDFS介绍-文件写流程

Client向NameNode发起文件写入的请求。

NameNode根据文件大小和文件块配置情况,返回给Client它所管理部分DataNode的信息。

Client将文件划分为多个Block,根据DataNode的地址信息,按顺序写入到每一个DataNode块中。

MapReduce——映射、化简编程模型

输入数据->Map分解任务->执行并返回结果->Reduce汇总结果->输出结果

Hbase——分布式数据存储系统

Client:使用HBase RPC机制与HMaster和HRegionServer进行通信

Zookeeper:协同服务管理,HMaster通过Zookeepe可以随时感知各个HRegionServer的健康状况

HMaster: 管理用户对表的增删改查操作

HRegionServer:HBase中最核心的模块,主要负责响应用户I/O请求,向HDFS文件系统中读写数据

HRegion:Hbase中分布式存储的最小单元,可以理解成一个Table

HStore:HBase存储的核心。由MemStore和StoreFile组成。

HLog:每次用户操作写入Memstore的同时,也会写一份数据到HLog文件

还有哪些NoSQL产品?

为什么要使用NoSQL?

一个高并发网站的DB进化史

关系模型>聚合数据模型的转换-基本变换

关系模型>聚合数据模型的转换-内嵌变换

关系模型>聚合数据模型的转换-分割变换

关系模型>聚合数据模型的转换-内联变换

Hadoop2.0

MapReduce: JobTracker:协调作业的运行。 TaskTracker:运行作业划分后的任务。

大数据的技术领域

腾讯大数据现状(资料来自2014.4.11 腾讯分享日大会)

腾讯大数据平台产品架构

腾讯大数据平台与业务平台的关系

公司数据处理平台的基础架构

公司大数据平台架构图

应用一数据分析

应用二视频存储

应用三离线日志分析

应用五在线数据分析

参考资料:京东基于Samza的流式计算实践

(文:昆明小虫)

来源:大数据魔镜

1、回复“数据分析师”查看数据分析师系列文章

2、回复“案例”查看大数据案例系列文章

3、回复“征信”查看相关征信的系列文章

4、回复“可视化”查看可视化专题系列文章

5、回复“SPPS”查看SPSS系列文章

6、回复“答案”查看hadoop面试题题目及答案

7、回复“爱情”查看大数据与爱情的故事

8、回复“笑话”查看大数据系列笑话

9、回复“大数据1、大数据2、大数据3、大数据4”查看大数据历史机遇连载

PPV课大数据ID: ppvke123 (长按可复制)

大数据人才的摇篮!专注大数据行业人才的培养。每日一课,大数据(EXCEL、SAS、SPSS、Hadoop、CDA)视频课程。大数据资讯,每日分享!数据咖—PPV课数据爱好者俱乐部!

本文分享自微信公众号 - PPV课数据科学社区(ppvke123)

原文出处及转载信息见文内详细说明,如有侵权,请联系 yunjia_community@tencent.com 删除。

原始发表时间:2015-11-30

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

我来说两句

0 条评论
登录 后参与评论

相关文章

  • 【学习】大数据相关术语500例解释及中英文对照①

    本文由36大数据编辑“陌上花”收集整理,转载必须标明来源36大数据和作者。 一、大数据 英文:big data,mega data 大数据,或称巨量资料,指的是...

    小莹莹
  • 【译文】数据科学家必须具备的9大能力

    【陆勤看点】如何认识和理解数据科学家?一种很好的方法就是查看数据科学家职位的描述,即数据科学家在公司中负责什么?数据科学家需要什么样职能要求?本文是一个数据科学...

    小莹莹
  • 星图数据谷熠:大数据的目的是提炼背后的价值

    ? 文/王曚 这两年大数据发展异常红火,从物联网到可穿戴设备一直都是科技媒体关注的话题。 昨日,网易科技采访了星图数据CEO谷熠,他表示,目前大数据主要体现的...

    小莹莹
  • 大咖周语录 | 沈南鹏透漏投资新风向,江颖说大数据时代传统咨询业必死!

    <数据猿导读> 对于大数据的概念以及大数据在各行业的应用,每个人心中都有不同的看法。小编每周都会整理大数据牛人们的精彩观点,让你在最短的时间获得最精的思想荟萃。...

    数据猿
  • 【重磅译文】大数据-风险管理新武器

    大数据文摘
  • 五种物联网大数据数据类型

    大数据,又称海量资料,是我们这个时代最伟大的经济机遇之一,但它的概念非常模糊。在一些谈话中,不同的参与者用大数据所表示的意思,可能有以下三种:大量的数据、超出传...

    GPUS Lady
  • 大数据24小时 | ThinkingData获百万级天使轮融资 Qlik在华成立新公司布局“大数据”

    贵安新区与上海贝格合作,共建“大数据小镇” ? 日前,贵州贵安新区与上海贝格数据公司宣布达成战略合作,据悉,上海贝格是一家基于金融大数据的服务供应商,旗下产品包...

    数据猿
  • 在投资人眼中,拥有“数据源”的企业才最有投资价值

    数据猿导读 金石投资是国内首批券商直投机构之一。金石投资高级副总裁韩平在接受数据猿记者采访时表示,在大数据产业链上的几个环节是他所看好的,他认为这些领域还存在很...

    数据猿
  • 国家发改委有关负责人就《促进大数据发展行动纲要》答记者问

    近日,国务院印发《促进大数据发展行动纲要》 (下称《纲要》),明确提出将全面推进我国大数据发展和应用,加快建设数据强国。就此,记者采访了国家发展改革委有关负责...

    灯塔大数据
  • 2016中国国际大数据大会召开

    <数据猿导读> 9月27日,2016中国国际大数据大会在京盛大开幕,本届大会主题为“数聚新动能数创大未来”。本届大会汇集了大数据产业链各环节共2000多位代表出...

    数据猿

扫码关注云+社区

领取腾讯云代金券