【Python机器学习】NLP词中的数学—

【Python机器学习】NLP词中的数学——齐普夫定律

本文主要是介绍【Python机器学习】NLP词中的数学——齐普夫定律，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

齐普夫定律指出：在给定的自然语言语料库中，任何一个词的频率与它在频率表中的排名成反比。

具体的说，这里的反比例关系指的是这样一种情况：排序列表中某一项的出现频率与其在排序列表中的排名成反比。例如，排序列表中的第一项出现的频率是第二项的2倍，是第三项的3倍。对于任何语料库或文档，我们可以快速做的一件事就是：绘制词的使用频率与它们的频率排名之间的关系。

齐普夫定律适用于很多东西的计数。比如某国城市人口与该人口排名之间的关系：

文字当然也满足相似的规律：

import nltk
nltk.download('brown')
from nltk.corpus import brownprint(brown.words()[:10])
print(brown.tagged_words()[:5])
print(len(brown.words()))

这是一个超过100万词条的文档，下面看一下其中的信息：

from collections import Counter
puncs=set((',','.','--','-','!','?',';',':','``',"''",'(',')','[',']'))
word_list=(x.lower() for x in brown.words() if x not in puncs)
token_counts=Counter(word_list)
print(token_counts.most_common(20))

上面语料库中的词频符合齐普夫预测的对数线性关系。“the”出现的频率大约是“of”的2倍、“and”的3倍。

简而言之，如果把语料库的词按照出现次数按降序排列，我们会发现：对一个足够大的样本，出现次数排名第一的词在语料库中出现次数是排名第二的词的两倍，是排名第四的词的四倍。因此，给定一个大型语料库，可以用上述数字来粗略统计给定词出现在该语料库的任何给定文档中的可能性。

这篇关于【Python机器学习】NLP词中的数学——齐普夫定律的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

【Python机器学习】NLP词中的数学——齐普夫定律

相关文章

Python Transformers库(NLP处理库)案例代码讲解

Python正则表达式语法及re模块中的常用函数详解

Python使用getopt处理命令行参数示例解析(最佳实践)

python实现svg图片转换为png和gif

Python中的getopt模块用法小结

Python利用ElementTree实现快速解析XML文件

Python如何精准判断某个进程是否在运行

使用Python从PPT文档中提取图片和图片信息(如坐标、宽度和高度等)

Python实现图片分割的多种方法总结

一文带你搞懂Python中init.py到底是什么