前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >6.0 MapReduce 使用

6.0 MapReduce 使用

作者头像
皮卡苏
发布2021-08-12 10:58:43
3370
发布2021-08-12 10:58:43
举报

在学习了之前的 MapReduce 概念之后,我们应该已经知道什么是 Map 和 Reduce,并了解了他们的工作方式。

本章将学习如何使用 MapReduce。

Word Count

Word Count 就是”词语统计”,这是 MapReduce 工作程序中最经典的一种。它的主要任务是对一个文本文件中的词语作归纳统计,统计出每个出现过的词语一共出现的次数。

Hadoop 中包含了许多经典的 MapReduce 示例程序,其中就包含 Word Count。

注意:这个案例在 HDFS 不运行的状态下依然可以运行,所以我们先在单机模式下测试

首先,启动一个之前制作的 hadoop_proto 镜像的新容器:

代码语言:javascript
复制
docker run -d --name=word_count hadoop_proto

进入容器:

代码语言:javascript
复制
docker exec -it word_count bash

进入 HOME 目录:

代码语言:javascript
复制
cd ~

现在我们准备一份文本文件 input.txt:

代码语言:javascript
复制
I love runoob
I like runoob
I love hadoop
I like hadoop

将以上内容用文本编辑器保存。

执行 MapReduce:

代码语言:javascript
复制
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.4.jar wordcount input.txt output

解释一下含义:

hadoop jar从 jar 文件执行 MapReduce 任务,之后跟着的是示例程序包的路径。

wordcount表示执行示例程序包中的 Word Count 程序,之后跟这两个参数,第一个是输入文件,第二个是输出结果的目录名(因为输出结果是多个文件)。

执行之后,应该会输出一个文件夹 output,在这个文件夹里有两个文件:_SUCCESS 和 part-r-00000。

其中 _SUCCESS 只是用于表达执行成功的空文件,part-r-00000 则是处理结果,当我们显示一下它的内容:

代码语言:javascript
复制
cat ~/output/part-r-00000

你应该可以看到如下信息:

代码语言:javascript
复制
I       4
hadoop  2
like    2
love    2
runoob  2

集群模式

现在我们在集群模式下运行 MapReduce。

启动在上一章配置好的集群容器:

代码语言:javascript
复制
docker start nn dn1 dn2

进入 NameNode 容器:

代码语言:javascript
复制
docker exec -it nn su hadoop

进入 HOME:

代码语言:javascript
复制
cd ~

编辑 input.txt:

代码语言:javascript
复制
I love runoob
I like runoob
I love hadoop
I like hadoop

启动 HDFS:

代码语言:javascript
复制
start-dfs.sh

创建目录:

代码语言:javascript
复制
hadoop fs -mkdir /wordcount
hadoop fs -mkdir /wordcount/input

上传 input.txt

代码语言:javascript
复制
hadoop fs -put input.txt /wordcount/input/

执行 Word Count:

代码语言:javascript
复制
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.4.jar wordcount /wordcount/input /wordcount/output

查看执行结果:

代码语言:javascript
复制
hadoop fs -cat /wordcount/output/part-r-00000

如果一切正常,将会显示以下结果:

代码语言:javascript
复制
I       4
hadoop  2
like    2
love    2
runoob  2

声明:版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • Word Count
  • 集群模式
相关产品与服务
容器服务
腾讯云容器服务(Tencent Kubernetes Engine, TKE)基于原生 kubernetes 提供以容器为核心的、高度可扩展的高性能容器管理服务,覆盖 Serverless、边缘计算、分布式云等多种业务部署场景,业内首创单个集群兼容多种计算节点的容器资源管理模式。同时产品作为云原生 Finops 领先布道者,主导开源项目Crane,全面助力客户实现资源优化、成本控制。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档