【如何用大语言模型快速深度学习系列】从word2vec、SVD到GloVe

2023-11-08 00:11

本文主要是介绍【如何用大语言模型快速深度学习系列】从word2vec、SVD到GloVe,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

三天热度果然名不虚传,写作的效率有所下降,但是只要坚持二十一天就能养成习惯啦!冲冲冲!
又被推进每日值得看啦!那我加油,尽量补充点内容,使其更加精彩!

上一节回顾 文章链接

在上一章我们将词的概念,通过n-gram组合成了n个词的切片,终于将前后词之间建立了一个联系,可以根据词的关系,逐步看见句子之间的相似度,以及根据高频词能够判断文章之间的关联程度。

上一节todo

  1. 相关代码未补充完整预计明后两天停更新新内容,将前面进行代码补全。
  2. 编辑距离忘了补充。
  3. jieba的详细介绍以及如何自己制作词典没有介绍。

写在第四节和第五节前面的引入部分

one-hot向量表示文本的不足之处
  1. one-hot太稀疏
    回到1-gram和2-gram的例子:
  • 我喜欢看电影
    用单词出现次数来表示:【“我”:1.“喜欢”:1,“看”:1,“电影”,1】

  • 我喜欢看电影。
    用2-词片段出现次数来表示:【“我喜欢”:1.“喜欢看”:1,“看电影”:1】

现在我们对“我”,“喜欢”,“看”,“电影” 进行编码,最简单的其实是我们一直以来的,按照索引,[1,0,0,0]第0个是“我”,[0,1,0,0]这是“喜欢”,而在不同的文章和规则下,比如2-gram下的,[1,0,0]表示“我喜欢”,在很长的文章里,则有数千甚至过万的词,编码格式为 [1,0,0…0],即为one-hot编码,为此,英文采用了基础词+前缀+后缀进行编码等奇思妙想来充分利用一些“0”,但这依然很稀疏

  1. one-hot近义词同义词很难体现
    如果按abc顺序进行排序,则“爱戴”,“尊敬”很难体现其应用场景相似相近,因为点乘永远是0。
    如果按偏旁部首排序,则“抵达”和“到达”很难体现其意义相近,同理
    如果按出现频率排序,按上一节tfidf,我们明白,高频词只有出现在少部分文章的时候,才具有意义,否则我们是会将其判断为停用词,即没有意义的词。
    如果用哈希表和预先拥有的知识构建词典,我觉得这个想法不错,但工作量巨大。
总之,one-hot的最大优点在于简单灵活、清晰明了,对于指定的、小文本任务中,依然发挥着十分重要的作用。而为了解决稀疏问题和词之间的语义联系等,我们可以阅读第四节 word2vec 和第五节 SVD 啦!

第四节 word2vec

概念

大模型对word2Vec
这个概念写的不是很符合我的心意,我们试试inscode
inscode结果
inscode字写得多,其实就会更加全面一些,但是单从回答依然可能看的是一头雾水,因此我还是会用通俗易懂的方式理解一下概念。

理解

还是从例子引入
设x1 = 苹果, x2 = 水果 x3 ≈ 中华田园犬,x4 = 狗
由苹果与水果的关系,中华田园犬与狗的关系都是被包含关系,于是理论上我们能确定一个关系式:word2vec (x2) - word2vec(x1) =(≈) word2vec(x4) - word2vec(x3)

  1. word2vector的目标将原本的一个词/词切片,经过编码就会变成一个低维度的向量(一个word 变成了 vector)比如有1万词,可能降低到16维,然后通过向量唯一表示该词
    注:图片引用自fond_dependent的这篇博客
  2. word2vector的向量应用这个向量可以描述词于词之间的关系,比如水果到苹果的向量之差就等于中华田园犬到狗之差。
  3. word2vector的向量的进一步推理自然而然的,苹果换成香蕉,仍然成立
    f(水果) - f(香蕉) ≈ f(狗) - f(中华田园犬) ≈ f(水果) - f(苹果),我们发现word2vector居然完成了f(香蕉) ≈ f(苹果),可以得到向量空间上两个向量的距离是靠近的!同时他们是唯一表示的,因此不会是等号。
  4. 关于距离与相似度 描述向量之间的距离有很多种,有多少种距离,就有更多种相似度的度量方法!

埋一个坑:做一个向量距离、相似度的整理与总结
再埋一个坑:做一个降维的方法总结,可能涉及到机器学习方法、深度学习方法

实现方法

上面是一些理论性的东西, 相信有了上面四个点的例子和推理,我们能对word2vector有了一个清晰的认识,而具体如何找到这个函数f(x),达到所需效果,现在更多会使用神经网络实现,我们可以忘记所有方法,把握两个关键点即可使用任何方法实现。

  1. 如何将10000个词字用16个维度表表示(10000和16突出的是降维程度之大)
    理论上,降维的方法有很多,设置降低到目标维度如何设置,最好等等,都是根据不同的任务进行确认。
    李沐的《动手学深度学习》中提供了代码视频,github代码,利用的是神经网络,然后我这两天也在尝试使用机器学习方法,然后用长短不一的数据集做一些实验进行对比,得到一些经验:

  2. 解决 f(香蕉) ≈ f(苹果)的方法:
    训练数据:基于大量的文本,用词语的前后词语来判断,如1:我去上海玩耍;2:我去南京玩耍,此时,上海和南京会被判断为类似,此时通过f(上海) = f(南京) 来调整权重。由此,我们可以退而求

  • 通过附近词预测中心词:CBOW,连续词袋模型,C指的是连续,BOW指的是词袋(第一节内容)

  • 通过中心词预测附近的词:Skip-gram,跳元模型,Skip指的是跳,-gram指的是n-gram是一样的(第二节内容)

总结

经过这一节,我们更多是停留在概念层次。代码部分即将有详细注释版

# 详细注释版 敬请期待

第五节 SVD


第六节 GloVe

这篇关于【如何用大语言模型快速深度学习系列】从word2vec、SVD到GloVe的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/366896

相关文章

使用Python实现快速搭建本地HTTP服务器

《使用Python实现快速搭建本地HTTP服务器》:本文主要介绍如何使用Python快速搭建本地HTTP服务器,轻松实现一键HTTP文件共享,同时结合二维码技术,让访问更简单,感兴趣的小伙伴可以了... 目录1. 概述2. 快速搭建 HTTP 文件共享服务2.1 核心思路2.2 代码实现2.3 代码解读3.

SpringCloud动态配置注解@RefreshScope与@Component的深度解析

《SpringCloud动态配置注解@RefreshScope与@Component的深度解析》在现代微服务架构中,动态配置管理是一个关键需求,本文将为大家介绍SpringCloud中相关的注解@Re... 目录引言1. @RefreshScope 的作用与原理1.1 什么是 @RefreshScope1.

springboot security快速使用示例详解

《springbootsecurity快速使用示例详解》:本文主要介绍springbootsecurity快速使用示例,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝... 目录创www.chinasem.cn建spring boot项目生成脚手架配置依赖接口示例代码项目结构启用s

Java的IO模型、Netty原理解析

《Java的IO模型、Netty原理解析》Java的I/O是以流的方式进行数据输入输出的,Java的类库涉及很多领域的IO内容:标准的输入输出,文件的操作、网络上的数据传输流、字符串流、对象流等,这篇... 目录1.什么是IO2.同步与异步、阻塞与非阻塞3.三种IO模型BIO(blocking I/O)NI

Python 中的异步与同步深度解析(实践记录)

《Python中的异步与同步深度解析(实践记录)》在Python编程世界里,异步和同步的概念是理解程序执行流程和性能优化的关键,这篇文章将带你深入了解它们的差异,以及阻塞和非阻塞的特性,同时通过实际... 目录python中的异步与同步:深度解析与实践异步与同步的定义异步同步阻塞与非阻塞的概念阻塞非阻塞同步

基于Flask框架添加多个AI模型的API并进行交互

《基于Flask框架添加多个AI模型的API并进行交互》:本文主要介绍如何基于Flask框架开发AI模型API管理系统,允许用户添加、删除不同AI模型的API密钥,感兴趣的可以了解下... 目录1. 概述2. 后端代码说明2.1 依赖库导入2.2 应用初始化2.3 API 存储字典2.4 路由函数2.5 应

C语言中的数据类型强制转换

《C语言中的数据类型强制转换》:本文主要介绍C语言中的数据类型强制转换方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录C语言数据类型强制转换自动转换强制转换类型总结C语言数据类型强制转换强制类型转换:是通过类型转换运算来实现的,主要的数据类型转换分为自动转换

利用Go语言开发文件操作工具轻松处理所有文件

《利用Go语言开发文件操作工具轻松处理所有文件》在后端开发中,文件操作是一个非常常见但又容易出错的场景,本文小编要向大家介绍一个强大的Go语言文件操作工具库,它能帮你轻松处理各种文件操作场景... 目录为什么需要这个工具?核心功能详解1. 文件/目录存javascript在性检查2. 批量创建目录3. 文件

C语言实现两个变量值交换的三种方式

《C语言实现两个变量值交换的三种方式》两个变量值的交换是编程中最常见的问题之一,以下将介绍三种变量的交换方式,其中第一种方式是最常用也是最实用的,后两种方式一般只在特殊限制下使用,需要的朋友可以参考下... 目录1.使用临时变量(推荐)2.相加和相减的方式(值较大时可能丢失数据)3.按位异或运算1.使用临时

使用C语言实现交换整数的奇数位和偶数位

《使用C语言实现交换整数的奇数位和偶数位》在C语言中,要交换一个整数的二进制位中的奇数位和偶数位,重点需要理解位操作,当我们谈论二进制位的奇数位和偶数位时,我们是指从右到左数的位置,本文给大家介绍了使... 目录一、问题描述二、解决思路三、函数实现四、宏实现五、总结一、问题描述使用C语言代码实现:将一个整