MySQL全文检索fulltext日语解析插件MeCab学习笔记

本文主要是介绍MySQL全文检索fulltext日语解析插件MeCab学习笔记,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

MySQL原始内置的全文检索(Full-Text Search)只适用于像英文这些词语之间有天然分隔符(如空格)的自然语言,MySQL5.7.6开始引入ngram full-text parser plugin,采用手动设置词语长度的方式进行人工分词,这可以作为CJK(Chinese、Japanese、Korean)语系全文检索的手段,具体可以参考之前的使用笔记:https://blog.csdn.net/sweeper_freedoman/article/details/82847754。但手动分词最大的局限性在于分词长度完全由参数设置,是一种机械式地文本操作。与ngram同一版本,MySQL同时也引入了MeCab full-text parser plugin。“MeCab”一词取自日语“和布蕪(めかぶ)”,原意是一种深海海藻,由京都大学和日本电信电话株式会社(NTT)共同研究开发,用于将日语解析成有实际意义的词语。例如,MeCab可以将“データベース管理”(“Database Management”)分词(tokenize)为“データベース”(“Database”)和“管理”(“Management”)。除了将文本tokenize成有实际意义的单词,MeCab全文索引通常比ngram索引小,因此MeCab通常查询更快。但与ngram相比,MeCab有个缺点就是可能需要花费更多的时间进行分词。

不同于MySQL的其他插件,使用MeCab需要额外安装配置。如果使用MySQL分发的MeCab包,可以直接配置使用。具体参考官方文档:https://dev.mysql.com/doc/refman/5.7/en/fulltext-search-mecab.html。个人本地是源码安装的MySQL,编译的时候没有加进MeCab的选项,所以没办法只能重新编译安装了一遍MySQL,即cmake的时候带上“-DWITH_MECAB=system”选项。不然最后安装“libpluginmecab.so”的时候会报错文件缺失。

mysql> INSTALL PLUGIN mecab SONAME 'libpluginmecab.so';
ERROR 1126 (HY000): Can't open shared library '/usr/local/mysql/lib/plugin/libpluginmecab.so' (errno: 2 /usr/local/mysql/lib/plugin/libpluginmecab.so: cannot open shared object file: No such file or directory)

安装MeCab包括安装MeCab解析插件和MeCab字典。可以从官网下载源码编译安装:http://taku910.github.io/mecab/#download。本地源码安装MeCab字典时也出现了报错文件缺失。以下是安装记录。

tar -xzv -f mecab-0.996.tar.gz
cd mecab-0.996/ ; ls
./configure
make
make check
make install
cd ..
tar -xzv -f mecab-ipadic-2.7.0-20070801.tar.gz
cd mecab-ipadic-2.7.0-20070801 ; ls
./configure --libdir=/usr/local/lib/libmecab.so.2 --with-charset=utf-8
make****************************这里报错了****************************/usr/local/libexec/mecab/mecab-dict-index -d . -o . -f EUC-JP -t utf-8/usr/local/libexec/mecab/mecab-dict-index: error while loading shared libraries: libmecab.so.2: cannot open shared object file: No such file or directoryMakefile:253: recipe for target 'matrix.bin' failedmake: *** [matrix.bin] Error 127****************************这里报错了****************************
make clean
test -z "matrix.bin char.bin sys.dic unk.dic" || rm -f matrix.bin char.bin sys.dic unk.dic
ldconfig
./configure --with-charset=utf-8
make
make install

不过因为本地是Ubuntu系统,也可以用apt超级命令简易安装。

apt install mecab
apt install mecab-ipadic

安装完成后可以在终端命令行输入mecab命令测试一下分词情况。以下是本地输入“すもももももももものうち”后的执行输出,这个也是MeCab官网给出的示例。

root@ubuntu:~# mecab
すもももももももものうち
すもも	名詞,一般,*,*,*,*,すもも,スモモ,スモモ
も	助詞,係助詞,*,*,*,*,も,モ,モ
もも	名詞,一般,*,*,*,*,もも,モモ,モモ
も	助詞,係助詞,*,*,*,*,も,モ,モ
もも	名詞,一般,*,*,*,*,もも,モモ,モモ
の	助詞,連体化,*,*,*,*,の,ノ,ノ
うち	名詞,非自立,副詞可能,*,*,*,うち,ウチ,ウチ
EOS

接下来需要修改配置文件,包括MySQL配置文件和MeCab配置文件。

MySQL配置文件需要在[mysqld]选项组中加入MeCab配置文件“mecabrc”的路径(个人本地位于“/etc/mecabrc”)和InnoDB全文检索的最小分词长度。

[mysqld]
# Mecab relevant
loose-mecab-rc-file = /etc/mecabrc# Fulltext search relevant
innodb_ft_min_token_size=1

MeCab配置文件主要是修改指定MeCab分词用字典,这里是注掉安装默认(注释符为“;”)然后改为“juman-utf8”。

; dicdir = /var/lib/mecab/dic/debian
dicdir = /var/lib/mecab/dic/juman-utf8

配置完成后,重启MySQL服务器,然后连接MySQL安装MySQL MeCab parser plugin。

mysql> INSTALL PLUGIN mecab SONAME 'libpluginmecab.so';
Query OK, 0 rows affected (0.03 sec)mysql> SHOW PLUGINS;

以下是运行MySQL官方文档的分词示例。

mysql> USE test;
ERROR 1049 (42000): Unknown database 'test'
mysql> 
mysql> CREATE DATABASE `test`;
Query OK, 1 row affected (0.00 sec)mysql> USE test;
Database changed
mysql> CREATE TABLE articles (->       id INT UNSIGNED AUTO_INCREMENT NOT NULL PRIMARY KEY,->       title VARCHAR(200),->       body TEXT,->       FULLTEXT (title,body) WITH PARSER mecab->     ) ENGINE=InnoDB CHARACTER SET utf8;
Query OK, 0 rows affected (0.10 sec)mysql> SET NAMES utf8;
Query OK, 0 rows affected (0.00 sec)mysql> INSERT INTO articles (title,body) VALUES->     ('データベース管理','このチュートリアルでは、私はどのようにデータベースを管理する方法を紹介します'),->     ('データベースアプリケーション開発','データベースアプリケーションを開発することを学ぶ');
Query OK, 2 rows affected (0.07 sec)
Records: 2  Duplicates: 0  Warnings: 0mysql> SET GLOBAL innodb_ft_aux_table="test/articles";
Query OK, 0 rows affected (0.00 sec)mysql> SELECT * FROM INFORMATION_SCHEMA.INNODB_FT_INDEX_CACHE ORDER BY doc_id, position;
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
| WORD                                       | FIRST_DOC_ID | LAST_DOC_ID | DOC_COUNT | DOC_ID | POSITION |
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
| データベース                               |            2 |           2 |         1 |      2 |        0 |
| は                                         |            2 |           2 |         1 |      2 |        9 |
| 管理                                       |            2 |           2 |         1 |      2 |       18 |
| を                                         |            2 |           3 |         2 |      2 |       21 |
| この                                       |            2 |           2 |         1 |      2 |       25 |
| チュートリアル                             |            2 |           2 |         1 |      2 |       31 |
| で                                         |            2 |           2 |         1 |      2 |       52 |
| は                                         |            2 |           2 |         1 |      2 |       55 |
| 、                                         |            2 |           2 |         1 |      2 |       58 |
| 私                                         |            2 |           2 |         1 |      2 |       61 |
| どのように                                 |            2 |           2 |         1 |      2 |       67 |
| データベース                               |            2 |           2 |         1 |      2 |       82 |
| 管理                                       |            2 |           2 |         1 |      2 |       85 |
| を                                         |            2 |           3 |         2 |      2 |      100 |
| する                                       |            2 |           3 |         2 |      2 |      109 |
| 方法                                       |            2 |           2 |         1 |      2 |      115 |
| 紹介                                       |            2 |           2 |         1 |      2 |      124 |
| し                                         |            2 |           2 |         1 |      2 |      130 |
| ます                                       |            2 |           2 |         1 |      2 |      133 |
| データベースアプリケーション               |            3 |           3 |         1 |      3 |        0 |
| を                                         |            2 |           3 |         2 |      3 |       21 |
| 開発                                       |            3 |           3 |         1 |      3 |       42 |
| データベースアプリケーション               |            3 |           3 |         1 |      3 |       49 |
| 開発                                       |            3 |           3 |         1 |      3 |       52 |
| を                                         |            2 |           3 |         2 |      3 |       91 |
| する                                       |            2 |           3 |         2 |      3 |      100 |
| こと                                       |            3 |           3 |         1 |      3 |      106 |
| 学ぶ                                       |            3 |           3 |         1 |      3 |      115 |
+--------------------------------------------+--------------+-------------+-----------+--------+----------+
28 rows in set (0.00 sec)mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース管理' IN NATURAL LANGUAGE MODE);
+----------+
| COUNT(*) |
+----------+
|        1 |
+----------+
1 row in set (0.00 sec)mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース管理' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
|        1 |
+----------+
1 row in set (0.00 sec)mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('データベース*' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
|        2 |
+----------+
1 row in set (0.00 sec)mysql> SELECT COUNT(*) FROM articles WHERE MATCH(title,body) AGAINST('"データベース管理"' IN BOOLEAN MODE);
+----------+
| COUNT(*) |
+----------+
|        1 |
+----------+
1 row in set (0.00 sec)

 

这篇关于MySQL全文检索fulltext日语解析插件MeCab学习笔记的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/760321

相关文章

网页解析 lxml 库--实战

lxml库使用流程 lxml 是 Python 的第三方解析库,完全使用 Python 语言编写,它对 XPath表达式提供了良好的支 持,因此能够了高效地解析 HTML/XML 文档。本节讲解如何通过 lxml 库解析 HTML 文档。 pip install lxml lxm| 库提供了一个 etree 模块,该模块专门用来解析 HTML/XML 文档,下面来介绍一下 lxml 库

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

SQL中的外键约束

外键约束用于表示两张表中的指标连接关系。外键约束的作用主要有以下三点: 1.确保子表中的某个字段(外键)只能引用父表中的有效记录2.主表中的列被删除时,子表中的关联列也会被删除3.主表中的列更新时,子表中的关联元素也会被更新 子表中的元素指向主表 以下是一个外键约束的实例展示

基于MySQL Binlog的Elasticsearch数据同步实践

一、为什么要做 随着马蜂窝的逐渐发展,我们的业务数据越来越多,单纯使用 MySQL 已经不能满足我们的数据查询需求,例如对于商品、订单等数据的多维度检索。 使用 Elasticsearch 存储业务数据可以很好的解决我们业务中的搜索需求。而数据进行异构存储后,随之而来的就是数据同步的问题。 二、现有方法及问题 对于数据同步,我们目前的解决方案是建立数据中间表。把需要检索的业务数据,统一放到一张M

如何去写一手好SQL

MySQL性能 最大数据量 抛开数据量和并发数,谈性能都是耍流氓。MySQL没有限制单表最大记录数,它取决于操作系统对文件大小的限制。 《阿里巴巴Java开发手册》提出单表行数超过500万行或者单表容量超过2GB,才推荐分库分表。性能由综合因素决定,抛开业务复杂度,影响程度依次是硬件配置、MySQL配置、数据表设计、索引优化。500万这个值仅供参考,并非铁律。 博主曾经操作过超过4亿行数据

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

性能分析之MySQL索引实战案例

文章目录 一、前言二、准备三、MySQL索引优化四、MySQL 索引知识回顾五、总结 一、前言 在上一讲性能工具之 JProfiler 简单登录案例分析实战中已经发现SQL没有建立索引问题,本文将一起从代码层去分析为什么没有建立索引? 开源ERP项目地址:https://gitee.com/jishenghua/JSH_ERP 二、准备 打开IDEA找到登录请求资源路径位置

MySQL数据库宕机,启动不起来,教你一招搞定!

作者介绍:老苏,10余年DBA工作运维经验,擅长Oracle、MySQL、PG、Mongodb数据库运维(如安装迁移,性能优化、故障应急处理等)公众号:老苏畅谈运维欢迎关注本人公众号,更多精彩与您分享。 MySQL数据库宕机,数据页损坏问题,启动不起来,该如何排查和解决,本文将为你说明具体的排查过程。 查看MySQL error日志 查看 MySQL error日志,排查哪个表(表空间