传统词嵌入方法的千层套路

2024-01-26 11:20

本文主要是介绍传统词嵌入方法的千层套路,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

诸神缄默不语-个人CSDN博文目录

在自然语言处理(NLP)领域,词嵌入是一种将词语转换为数值形式的方法,使计算机能够理解和处理语言数据。
词嵌入word embedding也叫文本向量化/文本表征。
本文将介绍几种流行的传统词嵌入方法。

文章目录

  • 0. 独热编码
  • 1. 词袋模型
  • 2. TF-IDF
  • 3. word2vec
    • 1. skip-gram
    • 2. CBOW
  • 4. LSA
  • 5. GloVe
  • 6. CoVe

0. 独热编码

one-hot encoding

将每个词表示为一维向量
在这里插入图片描述

1. 词袋模型

bag of word (BoW)

词袋模型是最简单的文本表示法之一。它将文本转换为一个长向量,这个向量的每一个元素代表词汇表中的一个词,并记录该词在文本中出现的次数。

在这里插入图片描述

  • 优点:简单易懂,易于实现。
  • 缺点:忽略了词语的顺序和上下文信息,无法捕捉词与词之间的关系。

sklearn的实现:

from sklearn.feature_extraction.text import CountVectorizercorpus  #由字符串组成的列表
vector = CountVectorizer().fit(corpus)
train_vector = vector.transform(corpus)

2. TF-IDF

term frequency-inverse document frequency

TF-IDF是一种用于信息检索和文本挖掘的常用加权技术。它评估一个词对于一个文档集或一个语料库中的其中一份文档的重要程度。

TF (Term Frequency)中文含义是词频,IDF (Inverse Document Frequency)中文含义是逆文本频率指数。

TF统计的是词语在特定文档中出现的频率,而IDF统计的是词语在其他文章中出现的频率,其处理基本逻辑是词语的重要性随着其在特定文档中出现的次数呈现递增趋势,但同时会随着其在语料库中其他文档中出现的频率递减下降(考虑到有些常用词在所有文档里面都很常见)。
数学表达式如下:
TF-IDF ( w , d ) = TF ( w , d ) × IDF ( w ) \text{TF-IDF}(w,d)=\text{TF}(w,d)\times \text{IDF}(w) TF-IDF(w,d)=TF(w,d)×IDF(w)

  • 优点:能够减少常见词的影响,突出重要词汇。
  • 缺点:与BoW一样,忽略了词序和上下文信息。

sklearn的实现:

from sklearn.feature_extraction.text import TfidfVectorizertfidf=TfidfVectorizer(max_features=500)
corpus  #由字符串组成的列表
sp_tfidf=tfidf.fit_transform(corpus)  #返回稀疏矩阵,每一行是语料中对应文档的表示向量

3. word2vec

Word2Vec是一种预测模型,用于产生词嵌入。它有两种结构:连续词袋(CBOW)和跳字模型(Skip-Gram)。

  • 优点:能够捕捉一定程度的词序和上下文信息。
  • 缺点:对于每个词仅有一个嵌入表示,忽略了多义性。

原始论文:
Distributed Representations of Sentences and Documents:提出word2vec框架
Efficient Estimation of Word Representations in Vector Space:介绍训练trick:hierarchical softmax 和 negative sampling

1. skip-gram

用一个词语作为输入,来预测它周围的上下文

训练思路:用独热编码表示词语。输入这个词语的独热编码,转换为隐藏层编码,输出上下文的独热编码
在这里插入图片描述

2. CBOW

Continues Bag of Words

拿一个词语的上下文作为输入,来预测这个词语本身

在这里插入图片描述

4. LSA

LSA使用奇异值分解(SVD)技术来减少特征空间的维数,并捕捉词之间的隐含关系。

  • 优点:能够改善稀疏性问题,捕捉词义关系。
  • 缺点:计算复杂,难以处理非常大的语料库。

5. GloVe

GloVe结合了矩阵分解和局部上下文窗口的优点。它通过词与词共现的概率信息来生成词向量。

  • 优点:在全局语料统计和局部上下文信息之间找到了平衡。
  • 缺点:需要大量的语料数据来有效训练。

6. CoVe

原论文:(2017) Learned in Translation: Contextualized Word Vectors

早期LM的感觉

CoVe是一种基于上下文的词嵌入方法,它利用序列到序列的模型从大量翻译数据中学习词向量。

  • 优点:能够捕捉上下文中的词义变化,处理多义性问题。
  • 缺点:模型较为复杂,需要大量的训练数据和计算资源。

在这里插入图片描述
Cove: 从Word2Vec/Glove的启示 - 知乎


以上就是几种传统的词嵌入方法的简介。每种方法都有其独特之处,选择适合的词嵌入技术可以极大地提升自然语言处理任务的性能。希望这篇文章能帮助你更好地理解不同的词嵌入方法,为你的NLP项目选择合适的技术。

参考资料:

  1. 文本向量化的六种常见模式
  2. 还没看完:
    1. [NLP] 秒懂词向量Word2vec的本质 - 知乎(整理到“我举个例子,假设全世界所有的词语总共有 V 个,这 V 个词语有自己的先后顺序,假设『吴彦”这一行)
    2. 全面理解word2vec
    3. word2vec简介
    4. 词向量学习算法 Glove - 简书
    5. A Neural Probabilistic Language Model
    6. NLP方向Word2vec算法面试题6道|含解析
    7. (2011 PMLR) Deep Learning for Efficient Discriminative Parsing
    8. 深度学习word2vec笔记之基础篇-CSDN博客
    9. word2vec Explained: deriving Mikolov et al.'s negative-sampling word-embedding method
    10. word2vec Parameter Learning Explained
    11. word2vec 相比之前的 Word Embedding 方法好在什么地方? - 知乎
    12. (2016 国科大博士论文) 基于神经网络的词和文档语义向量表示方法研究
    13. On word embeddings - Part 2: Approximating the Softmax

这篇关于传统词嵌入方法的千层套路的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/646636

相关文章

自定义注解SpringBoot防重复提交AOP方法详解

《自定义注解SpringBoot防重复提交AOP方法详解》该文章描述了一个防止重复提交的流程,通过HttpServletRequest对象获取请求信息,生成唯一标识,使用Redis分布式锁判断请求是否... 目录防重复提交流程引入依赖properties配置自定义注解切面Redis工具类controller

Java调用DeepSeek API的8个高频坑与解决方法

《Java调用DeepSeekAPI的8个高频坑与解决方法》现在大模型开发特别火,DeepSeek因为中文理解好、反应快、还便宜,不少Java开发者都用它,本文整理了最常踩的8个坑,希望对... 目录引言一、坑 1:Token 过期未处理,鉴权异常引发服务中断问题本质典型错误代码解决方案:实现 Token

Nginx 访问控制的多种方法

《Nginx访问控制的多种方法》本文系统介绍了Nginx实现Web访问控制的多种方法,包括IP黑白名单、路径/方法/参数控制、HTTP基本认证、防盗链机制、客户端证书校验、限速限流、地理位置控制等基... 目录一、IP 白名单与黑名单1. 允许/拒绝指定IP2. 全局黑名单二、基于路径、方法、参数的访问控制

Python中Request的安装以及简单的使用方法图文教程

《Python中Request的安装以及简单的使用方法图文教程》python里的request库经常被用于进行网络爬虫,想要学习网络爬虫的同学必须得安装request这个第三方库,:本文主要介绍P... 目录1.Requests 安装cmd 窗口安装为pycharm安装在pycharm设置中为项目安装req

nginx跨域访问配置的几种方法实现

《nginx跨域访问配置的几种方法实现》本文详细介绍了Nginx跨域配置方法,包括基本配置、只允许指定域名、携带Cookie的跨域、动态设置允许的Origin、支持不同路径的跨域控制、静态资源跨域以及... 目录一、基本跨域配置二、只允许指定域名跨域三、完整示例四、配置后重载 nginx五、注意事项六、支持

MySQL查看表的历史SQL的几种实现方法

《MySQL查看表的历史SQL的几种实现方法》:本文主要介绍多种查看MySQL表历史SQL的方法,包括通用查询日志、慢查询日志、performance_schema、binlog、第三方工具等,并... 目录mysql 查看某张表的历史SQL1.查看MySQL通用查询日志(需提前开启)2.查看慢查询日志3.

MySQL底层文件的查看和修改方法

《MySQL底层文件的查看和修改方法》MySQL底层文件分为文本类(可安全查看/修改)和二进制类(禁止手动操作),以下按「查看方法、修改方法、风险管控三部分详细说明,所有操作均以Linux环境为例,需... 目录引言一、mysql 底层文件的查看方法1. 先定位核心文件路径(基础前提)2. 文本类文件(可直

Java实现字符串大小写转换的常用方法

《Java实现字符串大小写转换的常用方法》在Java中,字符串大小写转换是文本处理的核心操作之一,Java提供了多种灵活的方式来实现大小写转换,适用于不同场景和需求,本文将全面解析大小写转换的各种方法... 目录前言核心转换方法1.String类的基础方法2. 考虑区域设置的转换3. 字符级别的转换高级转换

使用Python实现局域网远程监控电脑屏幕的方法

《使用Python实现局域网远程监控电脑屏幕的方法》文章介绍了两种使用Python在局域网内实现远程监控电脑屏幕的方法,方法一使用mss和socket,方法二使用PyAutoGUI和Flask,每种方... 目录方法一:使用mss和socket实现屏幕共享服务端(被监控端)客户端(监控端)方法二:使用PyA

检查 Nginx 是否启动的几种方法

《检查Nginx是否启动的几种方法》本文主要介绍了检查Nginx是否启动的几种方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学... 目录1. 使用 systemctl 命令(推荐)2. 使用 service 命令3. 检查进程是否存在4