MySQL 全文索引应用简明教程

本文从以下几个方面介绍下MySQL全文索引的基础知识:

  1. MySQL全文索引的几个注意事项
  2. 全文索引的语法
  3. 几种搜索类型的简介
  4. 几种搜索类型的实例

全文索引的几个注意事项

  • 搜索必须在类型为fulltext的索引列上,match中指定的列必须在fulltext中指定过
  • 仅能应用在表引擎为MyIsam类型的表中(MySQL 5.6以后也可以用在Innodb表引擎中了)
  • 仅能再char、varchar、text类型的列上面创建全文索引
  • 像普通索引一样,可以在定义表时指定,也可以在创建表后添加或者修改
  • 对于一个大数量级记录插入,向没有索引的表中插入数据后创建索引比向有索引的数据表中插入的过程要快很多
  • 搜索字符串必须是一个常量字符串,不能是表的列名
  • 在搜索记录的选择性超过50%的时候,认为没有匹配(只在自然搜索中限制)

全文索引搜索语法

其中在match里面指定的列名1、2等,就是在建立全文索引中指定的列名, 后面的搜索修饰符说明如下:

几种搜索类型的简介

上面的搜索修饰符,实际上说明了3种全文搜索类型

IN NATURAL LANGUAGE MODE

简介:默认的搜索形式(不加任何搜索修饰符或者修饰符为 IN NATURAL LANGUAGE MODE 的情况)

特点:

  1. 对于搜索字符串中的字符都解析为正常的字符,没有特殊意义
  2. 对屏蔽字符列表中的字符串进行过滤
  3. 当记录的选择性超过50%的时候,通常被认为是不匹配。
  4. 返回记录按照记录的相关性进行排序显示

IN BOOLEAN MODE

简介:布尔模式搜索(搜索修饰符为IN BOOLEAN MODE的情况)

特点:

  1. 会按照一定的规则解析搜索字符串中的特殊字符的含义,进行一些逻辑意义的规则。如:某个单词必须出现,或者不能出现等。
  2. 这种类型的搜索返回的记录是不按照相关性进行排序的

WITH QUERY EXPANSION

简介:一种稍微复杂的搜索形式,实际上是进行了2次自然搜索,可以返回记录直接简介性关系的记录,修饰词IN NATURAL LANGUAGE MODE WITH QUERY EXPANSION 或者WITH QUERY EXPANSION modifier

特点:这种类型的搜素,实际上提供了一种间接的搜索功能,比如:我搜索某个词,而且返回的第一行中却不包含搜索词中的任意字符串。可以根据第一次搜索结果的记录词进行第二次匹配,从而可能找到一些间接关系的匹配记录。

几种搜索类型的实例介绍

IN NATURAL LANGUAGE MODE模式下的应用:

还是应用在product表,其中在name字段我们建立了全文索引,因为我需要根据关键词在name列匹配出相关记录

Sql语句如下:

时间还不错,在将近87w的记录中命中了1w多条,耗时1.15秒,效果还是不错

注意:在默认的情况下已经是根据相关性从高到低返回记录了

我们可以SELECT match(name) against(‘auto’) FROM product 查看记录的相关性值,值都在0和1之间, 0代表记录不匹配

重要的几个特性:

1. 哪些词会被忽略

搜索词太短 默认全文索引认为4个以上字符的单词是有效词,我们可以在配置中修改ft_min_word_len进行配置

屏蔽词表中的词 默认的全文索引将一些常用词屏蔽掉,因为这些词太常见了,没有任何语义作用,所以搜索过程中是忽略不计的。当然这个列表也是可以配置的。

2. 如何进行分词的

全文索引认为一个连续的有效字符(正则中\w匹配的字符集)是一个单词,也可以包含一个“’”, 但是连续的两个’会被认为是一个分隔符。其他的分隔符如:空格、逗号、句点等

IN BOOLEAN MODE 模式下的应用:

在布尔匹配模式中,我们可以添加一些特殊的符号,增加一些搜索过程的逻辑功能。如官方网站中提供的实例(搜索含有mysql字符串 且 不含Yousql的语句):

可见,我们对搜索的控制又多了一些,看起来“高大上”了些。

实际上,上面的操作隐含了几个意思:

  • 加号:相当于and
  • 减号:相当于not
  • 没有:相当于or

下面看下布尔类型搜索的几个重要特性:

  • 1. 没有50%记录选择性的限制,即使搜索结果记录超过总数的50%也同样返回结果
  • 2. 不会自动的按记录的相关性进行降序排序
  • 3. 可以直接应用在没有创建fulltext的全文索引上,但是这样会查询的非常慢,所以说还是别用了。
  • 4. 支持最小、最大单词长度
  • 5. 应用屏蔽词列表

布尔搜索支持的操作符:

  • n 加号 +:指示修饰的单词必须出现在记录中
  • n 减号 -:指示修饰的单词必须不能出现在记录中
  • n 没有任何操作符:单词可有可无,但是包含该词的记录相关性高
  • n 双引号 “ : 将一个词组作为一个匹配。如:”one word” 匹配one word在一起的单词

下面是官方的一些实例:

了解了基本的mysql全文索引知识,觉得它的全文索引比like当然是强了很多。但是面对高级的搜索还是略显简陋,且性能问题也是担忧。

本人只是作为入门了解,也是对官网一些基本知识的翻译。

原文发布于微信公众号 - 顶级程序员(TopCoding)

原文发表时间:2016-10-19

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏简书专栏

Python程序结构2

上面一段代码的运行结果如下,从下面的结果可以看出速度差距为2、3倍左右,当数据量更大时,可能差距更大。:

11530
来自专栏恰童鞋骚年

Hadoop学习笔记—5.自定义类型处理手机上网日志

  假设我们如下一个日志文件,这个文件的内容是来自某个电信运营商的手机上网日志,文件的内容已经经过了优化,格式比较规整,便于学习研究。

8010
来自专栏向治洪

单例模式

单例对象(Singleton)是一种常用的设计模式。在Java应用中,单例对象能保证在一个JVM中,该对象只有一个实例存在。 这样的模式有几个好处: 1、某些...

19970
来自专栏GIS讲堂

数据库 连接(JOIN)

连接运算中有两种最为重要的连接,一种是等值连接(Equijoin),另一种是自然连接(Nature Join):等值连接是从关系R和S中的笛卡尔积中选取A,B属...

22330
来自专栏PHP在线

帮助你认识PHP的特点与发展

写在前面的话:之前做的一个项目,数据库及系统整体构架设计完成之后,和弟兄们经过一段时间的编码,系统如期上线,刚开始运行一切良好,后来随着数 据量的急剧膨胀,慢慢...

29330
来自专栏青玉伏案

Oracle常用函数

前一段时间学习Oracle 时做的学习笔记,整理了一下,下面是分享的Oracle常用函数的部分笔记,以后还会分享其他部分的笔记,请大家批评指正。 1.Oracl...

21890
来自专栏青玉伏案

iOS开发之SQLite--C语言接口规范(四) —— Result Values From A Query

  数据库的在上一篇博客中《SQLite之C语言接口规范(三)——Binding Values To Prepared Statements》用到了如何从查询结...

204100
来自专栏JMCui

Hybris IMPEX

1、Impex是基于java Model的一种面向对象的数据操作手段,因此写impex代码前需要理清java Model之间的依赖关系。 2、基本语法:mode...

39260
来自专栏xingoo, 一个梦想做发明家的程序员

Lucene查询语法详解

Lucene查询 Lucene查询语法以可读的方式书写,然后使用JavaCC进行词法转换,转换成机器可识别的查询。 下面着重介绍下Lucene支持的查询: Te...

57290
来自专栏IT可乐

Java设计模式之(一)------单例模式

1、什么是单例模式?   采取一定的办法保证在整个软件系统中,单例模式确保对于某个类只能存在一个实例。有如下三个特点:   ①、单例类只能有一个实例   ②、单...

22770

扫码关注云+社区

领取腾讯云代金券