【技术】图示大数据基本架构

大数据数量庞大,格式多样化。大量数据由家庭、制造工厂和办公场所的各种设备、互联网事务交易、社交网络的活动、自动化传感器、移动设备以及科研仪器等生成。它的爆炸式增长已超出了传统IT基础架构的处理能力,给企业和社会带来严峻的数据管理问题。因此必须开发新的数据架构,围绕“数据收集、数据管理、数据分析、知识形成、智慧行动”的全过程,开发使用这些数据,释放出更多数据的隐藏价值。

大数据基本架构应包括如图所示内容:

大数据基本架构参考如下:

1)数据的获得

大数据产生的根本原因在于感知式系统的广泛使用。随着技术的发展,人们已经有能力制造极其微小的带有处理功能的传感器,并开始将这些设备广泛的布置于社会的各个角落,通过这些设备来对整个社会的运转进行监控。这些设备会源源不断的产生新数据,这种数据的产生方式是自动的。因此在数据收集方面,要对来自网络包括物联网、社交网络和机构信息系统的数据附上时空标志,去伪存真,尽可能收集异源甚至是异构的数据,必要时还可与历史数据对照,多角度验证数据的全面性和可信性。

2、数据的汇集和存储:

数据只有不断流动和充分共享,才有生命力。应在各专用数据库建设的基础上,通过数据集成,实现各级各类信息系统的数据交换和数据共享。 数据存储要达到低成本、低能耗、高可靠性目标,通常要用到冗余配置、分布化和云计算技术,在存储时要按照一定规则对数据进行分类,通过过滤和去重,减少存储量,同时加入便于日后检索的标签。

3、数据的管理:

大数据管理的技术也层出不穷。在众多技术中,有6种数据管理技术普遍被关注,即分布式存储与计算、内存数据库技术、列式数据库技术、云数据库、非关系型的数据库、移动数据库技术。其中分布式存储与计算受关注度最高。下图是一个图书数据管理系统:

4、数据的分析

数据分析处理:有些行业的数据涉及上百个参数,其复杂性不仅体现在数据样本本身,更体现在多源异构、多实体和多空间之间的交互动态性,难以用传统的方法描述与度量,处理的复杂度很大,需要将高维图像等多媒体数据降维后度量与处理,利用上下文关联进行语义分析,从大量动态而且可能是模棱两可的数据中综合信息,并导出可理解的内容。大数据的处理类型很多,主要的处理模式可以分为流处理和批处理两种。批处理是先存储后处理,而流处理则是直接处理数据。挖掘的任务主要是关联分析、聚类分析、分类、预测、时序模式和偏差分析等。

5、大数据的价值:决策支持系统

大数据的神奇之处就是通过对过去和现在的数据进行分析,它能够精确预测未来;通过对组织内部的和外部的数据整合,它能够洞察事物之间的相关关系;通过对海量数据的挖掘,它能够代替人脑,承担起企业和社会管理的职责。

6、数据的使用:

大数据有三层内涵:一是数据量巨大、来源多样和类型多样的数据集;二是新型的数据处理和分析技术;三是运用数据分析形成价值。大数据对科学研究、经济建设、社会发展和文化生活等各个领域正在产生革命性的影响。大数据应用的关键,也是其必要条件,就在于"IT"与"经营"的融合,当然,这里的经营的内涵可以非常广泛,小至一个零售门店的经营,大至一个城市的经营。

原文发布于微信公众号 - PPV课数据科学社区(ppvke123)

原文发表时间:2014-04-16

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏AI科技评论

百度如何用人工智能做金融?| KDD China

AI科技评论按:在周日于深圳举行腾讯大数据技术峰会暨KDD China技术峰会上,百度金融服务事业群组研发负责人、KDD China副主席沈抖博士介绍了百度金融...

3138
来自专栏云计算D1net

企业通过公共云与私有云成本比较更好地发展业务

为了节省费用,将近一半的企业并没有采用公共云,并且表示已经找到了如何利用自己的私有云来避免采用公共云成本高昂的方法。 一批新的证据表明,比人们所想象还要多的企...

32811
来自专栏cloudskyme

建设全功能团队

简介 团队的开发人员撇开需求沉浸在想象中的“完美”程序中;测试人员迷茫的点击着按钮试图搞明白这到底是个什么功能;设计师造出了没有尽头 的楼梯,更糟的是,客户爱上...

3073
来自专栏WindCoder

广泛vs狭窄的技能树:软件工程技能揭秘

每个软件工程师都有自己掌握的技能。如果你掌握了一到两种技能,而其他的技能却很少,那么技能就是“深而窄”;如果你能在不成为任何领域的专家的情况下做一点事情,那就是...

921
来自专栏CDA数据分析师

O'Reilly2016数据科学从业者薪酬报告(附原文下载)

本中文版报告由CDA数据分析师依据O’Reilly的DATA SCIENCE SALARY SURVEY独家翻译制作,交流使用,请勿商用,转载请联系邮箱:zho...

2086
来自专栏祝威廉

研发的两观,全局观和产品观

前些天在杭州和W君漫步钱塘江赏霾,畅谈了两个小时,期间W君一直强调研发需要有产品观以及全局观。我很认同,但是毕竟这也对人要求很高。

1112
来自专栏顾宇的研习笔记

#DevOps的前世今生# 2. Dev和Ops矛盾缘何而来 ?

在#DevOps的前世今生# 1. DevOps编年史一文中,通过追溯 DevOps 活动产生的历史起源,我们发现了 DevOps 是敏捷思想从软件开发端(De...

672
来自专栏ThoughtWorks

如何培养技术洞见力? | TW洞见

今日洞见 本文作者:ThoughtWorks - 禚娴静。 本文所有内容,包括文字、图片和音视频资料,版权均属ThoughtWorks公司所有,任何媒体、网站或...

2984
来自专栏ATYUN订阅号

【业界】Mavenir收购Argyle Data 欲强化自身机器学习安全套件

Mavenir是一家软件公司,通过在网络基础设施堆栈的每一层(从5G应用/服务层到RAN和分组核心)提供全面的产品组合来加速和重新定义服务提供商的网络转型。Ma...

2945
来自专栏IT大咖说

干货 | OneAPM研发总监高海强:百万并发云压测平台的关键技术

嘉宾演讲视频 Guest Video ? 温馨提示 本视频时长55分46秒,建议在wifi下观看 5月13日,七牛云携手 OneAPM 共同为大家带来了一场精彩...

3848

扫码关注云+社区

领取腾讯云代金券