前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Spark伪分布式集群搭建

Spark伪分布式集群搭建

作者头像
CoderJed
发布2018-09-13 10:45:54
1.5K0
发布2018-09-13 10:45:54
举报
文章被收录于专栏:Jed的技术阶梯Jed的技术阶梯

软件准备


(1) 把安装包上传到服务器并解压

代码语言:javascript
复制
[root@repo soft]# tar -zxvf spark-2.2.0-bin-hadoop2.7.tgz -C /opt/

# 解压后如果感觉安装目录的名称太长可以修改一下
[root@repo soft]# cd /opt
[root@repo opt]# mv spark-2.2.0-bin-hadoop2.7 spark-2.2.0

(2) 修改spark-env.sh配置文件

代码语言:javascript
复制
# 把SPARK_HOME/conf/下的spark-env.sh.template文件复制为spark-env.sh
[root@repo opt]# cd spark-2.2.0/conf/
[root@repo conf]# cp spark-env.sh.template spark-env.sh

# 修改spark-env.sh配置文件,添加如下内容
[root@repo conf]# vim spark-env.sh

# 配置JAVA_HOME,一般来说,不配置也可以,但是可能会出现问题,还是配上吧
export JAVA_HOME=/usr/local/java/jdk1.8.0_73
# 一般来说,spark任务有很大可能性需要去HDFS上读取文件,所以配置上
# 如果说你的spark就读取本地文件,也不需要yarn管理,不用配
export HADOOP_CONF_DIR=/opt/hadoop-2.7.4/etc/hadoop

# 设置Master的主机名
export SPARK_MASTER_HOST=repo
# 提交Application的端口,默认就是这个,万一要改呢,改这里
export SPARK_MASTER_PORT=7077
# 每一个Worker最多可以使用的cpu core的个数,我虚拟机就一个...
# 真实服务器如果有32个,你可以设置为32个
export SPARK_WORKER_CORES=1
# 每一个Worker最多可以使用的内存,我的虚拟机就2g
# 真实服务器如果有128G,你可以设置为100G
export SPARK_WORKER_MEMORY=2g

(3) 修改slaves配置文件

代码语言:javascript
复制
[root@repo conf]# cp slaves.template slaves
[root@repo conf]# vim slaves

# 里面的内容原来为localhost,改为repo
repo

# 伪分布式就一台机器,用localhost也可以
# 但我们毕竟搭建的是伪分布式集群,注意,是集群
# 改成repo心里可能更相信它是一个分布式集群

(4) 配置SPARK_HOME环境变量

代码语言:javascript
复制
[root@repo conf]# vim /etc/profile

export SPARK_HOME=/opt/spark-2.2.0
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin

[root@repo conf]# source /etc/profile

(5) 启动spark伪分布式集群

注意:

  • 上一步配置了SPARK_HOME,所以在任意位置使用start-all.sh就可以启动spark集群
  • 但是,如果你也配置了HADOOP_HOME,在HADOOP_HOME/sbin目录下,也有start-all.sh和stop-all.sh这两个命令
  • 那么当你执行start-all.sh这个命令,可能会出错,尤其是执行stop-all.sh命令,如果你要停止spark集群,系统给你关闭了hadoop集群,不说了...

解决办法:

  1. 启动或关闭spark集群,即使你配置了环境变量,还是进入spark的sbin目录下去操作吧,那还配SPARK_HOME干嘛?我们可以在任意位置执行提交spark任务的命令。
代码语言:javascript
复制
[root@repo conf]# cd /opt/spark-2.2.0/sbin/
[root@repo sbin]# ./start-all.sh
  1. 把SPARK_HOME/sbin/目录下的start-all.sh和stop-all.sh两个命令修改一下名字,比如分别修改为start-spark-all.sh和stop-spark-all.sh,然后再执行,就不会与hadoop的命令冲突了
代码语言:javascript
复制
[root@repo sbin]# mv start-all.sh start-spark-all.sh
[root@repo sbin]# mv stop-all.sh stop-spark-all.sh

[root@repo sbin]# start-spark-all.sh

说明:

  • 如果你的配置文件中配置了HADOOP_CONF_DIR,在启动spark集群之前,先启动hadoop集群

(6) 验证

代码语言:javascript
复制
[root@repo sbin]# jps
8576 Jps
8449 Master
8504 Worker

访问WEB页面

spark伪分布式集群搭建成功!

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2018.01.10 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • (1) 把安装包上传到服务器并解压
  • (2) 修改spark-env.sh配置文件
  • (3) 修改slaves配置文件
  • (4) 配置SPARK_HOME环境变量
  • (5) 启动spark伪分布式集群
  • (6) 验证
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档