前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >spark集群使用hanlp进行分布式分词操作说明

spark集群使用hanlp进行分布式分词操作说明

作者头像
IT小白龙
修改2019-01-21 10:29:55
7590
修改2019-01-21 10:29:55
举报

本篇分享一个使用hanlp分词的操作小案例,即在spark集群中使用hanlp完成分布式分词的操作,文章整理自【qq_33872191】的博客,感谢分享!以下为全文:

分两步:

第一步:实现hankcs.hanlp/corpus.io.IIOAdapter

1. public class HadoopFileIoAdapter implements IIOAdapter {

2.

3.   @Override

4.    public InputStream open(String path) throws IOException {

5.        Configuration conf = new Configuration();

6.       FileSystem fs = FileSystem.get(URI.create(path), conf);

7.        return fs.open(new Path(path));

8.    }

9.

10.    @Override

11.   public OutputStream create(String path) throws IOException {

12.        Configuration conf = new Configuration();

13.        FileSystem fs = FileSystem.get(URI.create(path), conf);

14.        OutputStream out = fs.create(new Path(path));

15.        return out;

16.    }

17.  }

第二步:修改配置文件。root为hdfs上的数据包,把IOAdapter改为咱们上面实现的类

ok,这样你就能在分布式集群上使用hanlp进行分词了。

整个步骤比较简单,欢迎各位大神交流探讨!

本文系转载,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文系转载前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档