mysql全文索引的原理

tulayang 发布于2019-07-01 12:19 / 2412人阅读

摘要：分词的方法基本上是二元分词法最大匹配法和统计方法。索引的数据结构基本上采用倒排索引的结构。全文检索的索引被称为倒排索引，之所以成为倒排索引，是因为将每一个单词作为索引项，根据该索引项查找包含该单词的文本。

全文检索是对大数据文本进行索引，在建立的索引中对要查找的单词进行进行搜索，定位哪些文本数据包括要搜索的单词。因此，全文检索的全部工作就是建立索引和在索引中搜索定位，所有的工作都是围绕这两个来进行的。

建立全文索引中有两项非常重要，一个是如何对文本进行分词，一是建立索引的数据结构。分词的方法基本上是二元分词法、最大匹配法和统计方法。索引的数据结构基本上采用倒排索引的结构。

分词的好坏关系到查询的准确程度和生成的索引的大小。在中文分词发展中，早期经常使用分词方式是二元分词法，该方法的基本原理是将包含中文的句子进行二元分割，不考虑单词含义，只对二元单词进行索引。因此该方法所分出的单词数量较多，从而产生的索引数量巨大，查询中会将无用的数据检索出来，好处是算法简单不会漏掉检索的数据。之后又发展出最大匹配分词方法，该方法又分为正向最大分词和逆向最大分词。其原理和查字典类似，对常用单词生成一个词典，分析句子的过程中最大的匹配字典中的单词，从而将句子拆分为有意义的单词链。最大匹配法中正向分词方法对偏正式词语的分辨容易产生错误，比如“首饰和服装”会将“和服”作为单词分出。达梦数据库采用的是改进的逆向最大分词方法，该分词方法较正向正确率有所提高。最为复杂的是通过统计方式进行分词的方法。该方法采用隐式马尔科夫链，也就是后一个单词出现的概率依靠于前一个单词出现的概率，最后统计所有单词出现的概率的最大为分词的依据。这个方法对新名词和地名的识别要远远高于最大匹配法，准确度随着取样文本的数量的增大而提高。

　二元分词方法和统计方法是不依赖于词典的，而最大匹配法分词方法是依赖于词典的，词典的内容决定分词结构的好坏。

全文检索的索引被称为倒排索引，之所以成为倒排索引，是因为将每一个单词作为索引项，根据该索引项查找包含该单词的文本。因此，索引都是单词和唯一记录文本的标示是一对多的关系。将索引单词排序，根据排序后的单词定位包含该单词的文本。

GPU云服务器云服务器 mysql索引原理全文索引 sql server 全文索引 mysql索引性能的问题

文章版权归作者所有，未经允许请勿转载,若此文章存在违规行为，您可以联系管理员删除。

转载请注明本文地址：https://www.ucloud.cn/yun/30494.html

发表评论

登陆后可评论

0条评论

tulayang

男|高级讲师

我要关注我要私信

TA的文章

自动化测试框架指南

阅读 1648·2021-09-02 15:41
Python正则表达式保姆式教学，带你精通大名鼎鼎的正则！

阅读 1041·2021-09-02 15:11
RackNerd：$19.99/年KVM-1.8GB/28GB/3TB/洛杉矶机房

阅读 1333·2021-07-28 00:15
支付宝小程序编译less

阅读 2377·2019-08-30 15:55
伪元素的margin值挤压主体元素解决

阅读 1193·2019-08-30 15:54
5分钟理解BFC原理

阅读 1741·2019-08-30 15:54
我是如何通过debug成功甩锅浏览器的：解决fixed定位元素，在页面滚动后touch事件失效问题

阅读 3011·2019-08-30 14:02
JavaScript 高级程序设计（第三版）笔记

阅读 2563·2019-08-29 16:57

资讯专栏INFORMATION COLUMN

上云采购季！| 2核2G4M爆款云服务器低至59元/年，更有多台、长期优惠，快来选购！

mysql全文索引的原理

相关文章

发表评论

0条评论

tulayang

男|高级讲师

TA的文章

自动化测试框架指南

Python正则表达式保姆式教学，带你精通大名鼎鼎的正则！

RackNerd：$19.99/年KVM-1.8GB/28GB/3TB/洛杉矶机房

支付宝小程序编译less

伪元素的margin值挤压主体元素解决

5分钟理解BFC原理

我是如何通过debug成功甩锅浏览器的：解决fixed定位元素，在页面滚动后touch事件失效问题

JavaScript 高级程序设计（第三版）笔记

最新活动