如何进行大数据分析与处理

如何进行大数据分析与处理

1大数据分析

1.可视化分析

大数据分析的使用者有大数据分析专家,同时还有普通用户,但是他们二者对于大数据分析最基本的要求就是可视化分析,因为可视化分析能够直观的呈现大数据特点,同时能够非常容易被读者所接受

2. 数据挖掘算法 大数据分析的理论核心就是数据挖掘算法,各种数据挖掘的算法基于不同的数据类型和格式才能更加科学的呈现出数据本身具备的特点

3. 预测性分析 大数据分析最终要的应用领域之一就是预测性分析,从大数据中挖掘出特点,通过科学的建立模型,之后便可以通过模型带入新的数据,从而预测未来的数据。

4. 语义引擎

非结构化数据的多元化给数据分析带来新的挑战,我们需要一套工具系统的去分析,提炼数据。语义引擎需要设计到有足够的人工智能以足以从数据中主动地提取信息。

5.数据质量和数据管理

大数据分析离不开数据质量和数据管理,高质量的数据和有效的数据管理,无论是在学术研究还是在商业应用领域,都能够保证分析结果的真实和有价值

2大数据处理

1. 大数据处理之一:采集 大数据的采集是指利用多个数据库来接收发自客户端(Web、App或者传感器形式等)的 数据,并且用户可以通过这些数据库来进行简单的查询和处理工作,在大数据的采集过程中,其主要特点和挑战是并发数高,因为同时有可能会有成千上万的用户 来进行访问和操作

2.大数据处理之二:导入/预处理

虽然采集端本身会有很多数据库,但是如果要对这些海量数据进行有效的分析,还是应该将这 些来自前端的数据导入到一个集中的大型分布式数据库,或者分布式存储集群,并且可以在导入基础上做一些简单的清洗和预处理工作。导入与预处理过程的特点和挑战主要是导入的数据量大,每秒钟的导入量经常会达到百兆,甚至千兆级别。

3. 大数据处理之三:统计/分析 统计与分析主要利用分布式数据库,或者分布式计算集群来对存储于其内的海量数据进行普通 的分析和分类汇总等,以满足大多数常见的分析需求,在这方面,一些实时性需求会用到EMC的GreenPlum、Oracle的Exadata,以及基于 MySQL的列式存储Infobright等,而一些批处理,或者基于半结构化数据的需求可以使用Hadoop。 统计与分析这部分的主要特点和挑战是分析涉及的数据量大,其对系统资源,特别是I/O会有极大的占用。

4.大数据处理之四:挖掘 主要是在现有数 据上面进行基于各种算法的计算,从而起到预测(Predict)的效果,从而实现一些高级别数据分析的需求。主要使用的工具有Hadoop的Mahout等。该过程的特点和挑战主要是用于挖掘的算法很复杂,并 且计算涉及的数据量和计算量都很大,常用数据挖掘算法都以单线程为主

本文分享自微信公众号 - 加米谷大数据(DtinoneBD)

原文出处及转载信息见文内详细说明,如有侵权,请联系 yunjia_community@tencent.com 删除。

原始发表时间:2018-10-12

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏生信技能树

TCGA的28篇教程-GTEx数据库-TCGA数据挖掘的好帮手

这个时候我们就需要想办法加大正常组织测序样本量,既然TCGA数据库没有,我们就从其他数据库着手。

1.3K50
来自专栏SIGAI学习与实践平台

双线性汇合(bilinear pooling)在细粒度图像分析及其他领域的进展综述

细粒度图像分类旨在同一大类图像的确切子类。由于不同子类之间的视觉差异很小,而且容易受姿势、视角、图像中目标位置等影响,这是一个很有挑战性的任务。因此,类间差异通...

95530
来自专栏镁客网

无上限年薪争AI人才,大企“抢人”,小企为难

想要在北京三环内买套100平方米的房子,按照首付两成计算,律所应届生需要8.3年,四大应届生则是6.9年,如果恰好是AI领域毕业生,那么恭喜了!3年太长,1.2...

12340
来自专栏Python数据科学

【机器学习笔记】:从零开始学会逻辑回归(一)

逻辑回归是一个非常经典,也是很常用的模型。之前和大家分享过它的重要性:5个原因告诉你:为什么在成为数据科学家之前,“逻辑回归”是第一个需要学习的

11810
来自专栏生信技能树

TCGA数据库的肿瘤病人也是有药物反应信息的

To determine whether cancer cell line based LENP model could predict patient dru...

27910
来自专栏AI科技评论

2019 AAAI Fellow 出炉,罗杰波、刘欢两位华人学者入选

AI 科技评论消息:日前,国际人工智能学会(前身为美国人工智能学会)AAAI 宣布,全球有 7 位学者当选为 Fellow。其中有两位华人学者,分别是美国罗彻斯...

13020
来自专栏互联网数据官iCDO

iCDO一周数据要闻:苹果将下调日本iPhone XR价格;Ins将使用机器学习打击买粉买赞;5G云服务市场规模达4100亿美元

11月21日 亚马逊欲在线下普及Amazon Pay,挑战苹果Apple Pay

13430
来自专栏京东技术

京东荣获科促会科技产业化特等奖 无界零售已成传统产业升级利器

当前,全球的线下零售业态主要以传统的进销渠道为主,部分品类的区域特征较为明显,总体来看互联网IT服务与信息技术的使用渗透率不高。京东作为实体经济与数字经济深度融...

11630
来自专栏新智元

AI应届博士年薪80万起步,BAT校招数据大披露:缺人!

据第一财经报道,今年,AI领域应届毕业生薪水行情仍在噌噌上涨。去年,应届博士生能拿到高达50万元的年薪,今年薪水则涨到80万元。

58520
来自专栏Debian社区

Scrapy 架构及数据流图简介

Scrapy 是一个为了爬取网站数据,提取结构性数据而编写的应用框架。 可以应用在包括数据挖掘、信息处理或存储历史数据等一系列的程序中。本文着重介绍 Scrap...

15140

扫码关注云+社区

领取腾讯云代金券

年度创作总结 领取年终奖励