大数据服务上云的思考

说说大数据怎么上云的一些思考:

1、首先说说,大数据和云的关系。云是一种网络形态的概念,是继1980年代大型计算机到客户端-服务器的大转变之后的又一种巨变。云计算(CloudComputing)是分布式计算(DistributedComputing)、并行计算(ParallelComputing)、效用计算(UtilityComputing)、网络存储(NetworkStorage Technologies)、虚拟化(Virtualization)、负载均衡(Load Balance)、热备份冗余(HighAvailable)等传统计算机和网络技术发展融合的产物。除了技术上的融合形态,更重要的体现了一种服务模式的一种融合和改变,对于云来说,大数据只是上面的一种服务,和其他的web服务,数据库服务没有区别。

2、I层(云的基础设施)现在业界最火的方案是OpenStack。OpenStack是一个由NASA(美国国家航空航天局)和Rackspace合作研发并发起的,以Apache许可证授权的自由软件和开放源代码项目。

OpenStack是一个开源的云计算管理平台项目,由几个主要的组件组合起来完成具体工作。OpenStack支持几乎所有类型的云环境,项目目标是提供实施简单、可大规模扩展、丰富、标准统一的云计算管理平台。OpenStack通过各种互补的服务提供了基础设施即服务(IaaS)的解决方案,每个服务提供API以进行集成。

OpenStack云计算平台,帮助服务商和企业内部实现类似于 Amazon EC2 和 S3 的云基础架构服务(Infrastructure as a Service,IaaS)。OpenStack 包含两个主要模块:Nova 和 Swift,前者是 NASA 开发的虚拟服务器部署和业务计算模块;后者是 Rackspace开发的分布式云存储模块,两者可以一起用,也可以分开单独用。OpenStack除了有 Rackspace 和 NASA 的大力支持外,还有包括 Dell、Citrix、 Cisco、 Canonical等重量级公司的贡献和支持,发展速度非常快。

在云环境中,Openstack解决了I层的问题,所有的物理资源的管理和分配由I层来负责。

3、正是因为I层将资源和存储进行了虚拟化然后对上提供,大数据上云最大的两个问题是资源管理和数据存储。同时大数据又是重载的业务,对资源的需求非常高,因此需要大数据和openstack充分配合,大数据上云才能运行的好。

4、传统数据中心,大数据集群的资源管理和分配目前主要的方案是mesos/YARN。

从上图大家可以看出,Mesos/YARN来对物理资源直接进行管理,然后分配给上层的组件使用。 资源隔离方面,docker方案发展很快,所以又有YARN和kubernets结合的方案。PaaS作为一个服务直接架在YARN上。在没有直接I层能力的情下,应该是非常合适的一种的过渡方案,但是如果YARN管理的不是直接的物理资源,而是I层虚拟出来的VM/docker之类,mesos/YARN和I层的能力就出现了一定的重合和冲突,这个时候mesos/YARN应该把VM/Docker级资源管理和分配的能力释放给I层,聚焦于job级资源的分配和调度。此时PaaS在架构在YARN/MESOS上就非常多余。

5、对于存储存在同样的问题,HDFS是对物理硬盘的直接抽象成对象存储,并提供3份冗余来保障数据的可靠性。云上的I层对存储通常也会抽象,并且进行一定的冗余,来动态分配给上层应用。HDFS直接架在I层上,就存在反复冗余的问题。同时大数据的核心是对数据的处理,数据存储的位置对性能起到非常关键的作用,多层反复虚拟化之后,数据存储的不确定性,性能损耗非常大。因此I层最好将物理硬盘直接提供出来给大数据服务可见,让用数据的人直接管理数据效率最高。

原文发布于微信公众号 - 大数据和云计算技术(jiezhu2007)

原文发表时间:2015-05-02

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏云计算D1net

灾难发生时云备份至关重要

2017年9月和10月对许多人来说可能记忆深刻。哈维飓风在9月袭击了美国德克萨斯州,几个星期后,伊尔玛飓风对佛罗里达州造成了严重破坏,随后在墨西哥和危地马拉发生...

2806
来自专栏云计算D1net

采用存储即服务优化混合云平台

在混合云计算中,存储数据的位置对整体性能有重大影响。用户需要了解SaaS如何解决混合云数据管理和延迟问题。 通过云爆发的能力,混合云平台提供了巨大的计算灵活性。...

3545
来自专栏云技术

腾讯云如何快速从IPv4向IPv6演进?

IPv6技术在国内沉寂数十年后,在国家推进下重新登上重要舞台。2018年工业和信息化部发布了关于贯彻落实《推进互联网协议第六版(IPv6)规模部署行动计划》的通...

1632
来自专栏CSDN技术头条

张升:农业银行的分布式架构应用实践与展望

近年来,以阿里为代表的互联网企业提出的“去IOE”,在业界引起了广泛的讨论。“去IOE”直接含义是不使用传统IT巨头的产品,这些厂商产品虽然好,但基本处于市场垄...

1747
来自专栏hi

饿了么大数据离线计算引擎实践

  饿了么BDI-大数据平台研发团队目前共有20人左右,主要负责离线&实时 Infra 和平台工具开发。其中6人的离线团队需要维护大数据集群规模如下,

2453
来自专栏云计算D1net

混合云:如何优化企业网络设计

公有和混合云引入给企业网络设计带来了重大影响。新的瓶颈出现了,并且一些企业需要改变它们的网络配置——特别是广域网的配置——来确保能够得到所需的性能。 特别是在混...

2678
来自专栏JAVA高级架构

京东架构专家分享京东架构之路

京东咚咚架构演进 咚咚是什么?咚咚之于京东相当于旺旺之于淘宝,它们都是服务于买家和卖家的沟通。 自从京东开始为第三方卖家提供入驻平台服务后,咚咚也就随之诞生了。...

2989
来自专栏SDNLAB

软件定义架构实现云接入的网络优化

每个人都在谈论云计算将给业界带来的巨大改变,以及云计算技术如何发展为最终用户提供无限的应用程序、数据和服务。然而,只要网络方面还存在瓶颈,云计算架构的效率就无法...

33710
来自专栏TEG云端专业号的专栏

「TEG+系列」破局者 - 腾讯金融级数据库TDSQL

一 背景 金融行业的数据库市场,尤其是银行的核心交易系统,一直是Oracle、DB2这类传统商业数据库的天下,但是: 2014年,微众银行选用TDSQL作为其核...

3565
来自专栏云计算D1net

如何构建一个私有存储云

企业构建内部云存储时必须考虑弹性,选择正确的平台,并允许工作流,堆栈部署和公共云集成。 每个云存储选项都有其优点和缺点。企业需要根据自己的具体需求,规模大小,以...

2696

扫描关注云+社区