前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Solr配置中文分词器mmseg4j详解

Solr配置中文分词器mmseg4j详解

作者头像
星哥玩云
发布2022-07-04 10:46:13
3690
发布2022-07-04 10:46:13
举报
文章被收录于专栏:开源部署开源部署

针对Solr的分词器比较多,其中最常用的的两个是mmseg4j和ik-analyzer,至于他们的区别可以网上查找比较下,这两个分词器都挺好用。我搭建的Solr环境(上一篇 http://www.linuxidc.com/Linux/2015-01/112393.htm)是4.10.3的最新版本,以下将详细说下mmseg4j的配置。

1.首先下载对应的jar包。

版本号一定要对应上否则可能会报错,下载地址为:http://code.google.com/p/mmseg4j/ 但是这个网址好像需要翻墙,所以大家可以到我的上传资源下载:http://download.csdn.net/download/tjcyjd/8394095 。

2.将jar包拷贝到服务器solr的lib包下。

三个包:mmseg4j-solr-2.2.0.jar,mmseg4j-analysis-1.9.1.jar,mmseg4j-solr-2.2.0.jar

3.配置schema.xml。

schema.xml的配置也挺简单,首先需要在schema.xml文件中配置一个fieldType节点,如下:

<!-- mmseg4j --> <fieldType name="text_zh" class="solr.TextField" positionIncrementGap="100"> <span style="white-space:pre"> </span><analyzer> <span style="white-space:pre">  </span><tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" /> <span style="white-space:pre"> </span></analyzer> </fieldType>

然后就可以在field节点中引用该filedType了,假设你有个字段叫my_content需要支持中文分词,只需要定义示例filed节点如下:

<field name="my_content" type="text_zh" indexed="true" stored="false" multiValued="true"/>

4.重启Solr服务器

5.测试。

浏览器输入地址:http://localhost:8080/solr/

解析“有什么好的电影推荐吗”的效果如下图:

Solr配置中文分词器mmseg4j详解
Solr配置中文分词器mmseg4j详解
本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档