本文主要是介绍python中的jieba的作用_Python jieba结巴分词原理及用法解析,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!
1、简要说明
结巴分词支持三种分词模式,支持繁体字,支持自定义词典
2、三种分词模式
全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义
精简模式:把句子最精确的分开,不会添加多余单词,看起来就像是把句子分割一下
搜索引擎模式:在精简模式下,对长词再度切分
# -*- encoding=utf-8 -*-
import jieba
if __name__ == '__main__':
str1 = '我去北京天安门广场跳舞'
a = jieba.lcut(str1, cut_all=True) # 全模式
print('全模式:{}'.format(a))
b = jieba.lcut(str1, cut_all=False) # 精简模式
print('精简模式:{}'.format(b))
c = jieba.lcut_for_search(str1) # 搜索引擎模式
print('搜索引擎模式:{}'.format(c))
运行
3、某个词语不能被分开
# -*- encoding=utf-8 -*-
import jieba
这篇关于python中的jieba的作用_Python jieba结巴分词原理及用法解析的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!