NLP学习06_评估语言模型smoothing

2024-04-09 12:48

本文主要是介绍NLP学习06_评估语言模型smoothing,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

估计语言模型的概率

Unigram

首先统计语料库中所有的单词个数,然后统计每个单词出现的概率,
计算整句的概率
但是这种LM中,如果一个句子中的单词在语料库中没有出现,那么这个词的概率为0,这就导致整个句子概率为0
这显然是不合适的,用到一个平滑操作,使得虽然概率很小,但是不让它为0
在这里插入图片描述

Bigram

除了第一个单词的概率要通过Unigram计算,其他后边都是条件概率,要先在语料库找到条件词出现的个数
然后看这个条件词后跟目标词的个数,统计出概率相乘
在这里插入图片描述

N-gram

在这里插入图片描述
由上可知,这种N-gram的语言模型总是会出现某一个单词或者单词序列没有而导致整个句子的概率为0 的情况

评估语言模型

在一个任务上进行模型评估,必须将整个系统实现,然后才能计算准确率,这个过程是很耗时的
在这里插入图片描述
所以考虑先对模型进行评估,然后在用到任务上,
在任务外进行评估,具有公平性,而且可以跟很多模型比较

Perplexity:用来评估模型

在这里插入图片描述
在一个已经训练好的LM中
计算P,然后计算logP,求和,再平均,得到的结果就是x,把x代到公式perplexity = 2^-x
得到perplexity
在这里插入图片描述
不同应用场景使用的评估方法不同
在这里插入图片描述
在上边的测试结果中,Trigram的perplexity最小,所以模型最好
N-gram,N越大,模型越复杂, 越倾向于过拟合

平滑smoothing

在这里插入图片描述
由于某一个概率为0,导致整个句子的概率为0,这样导致不同语法的句子表现不出区别,所以要使用平滑的技术

平滑分为不同的方法

在这里插入图片描述
MLE:最大似然估计

add-one smoothing

也叫拉普拉斯平滑项
之前我们计算的基于前一个词的概率是最大似然估计,可能会出现概率为0,
但是平滑处理就是要给他加一个很小的概率
分子上加1,分母上加V,V即词典的大小(排除重复的单词)
在这里插入图片描述
在这里插入图片描述
之所以在分母位置加V,目的是所有的可能项平滑操作后的概率之和为1

add-K smoothing

K=1时就是add-one
这个K的值可以自己去调试,也可以通过训练得到
在这里插入图片描述
K的选择,可以通过尝试来确定,也可以通过优化的方法确定
在这里插入图片描述
比如我们在训练集已经得到LM,也就是知道词的概率,然后用到验证集上,就可以得到perplexity关于f(k)的函数
因为perplexity是越小,模型越好,所以我们找perplexity最小时的K,就是我们想要的K

平滑方法三:Interpolation

问题:当使用Trigram LM时,由于in the 没有在训练集中出现,所以导致两个条件概率都是0,但是根据实际经验,在训练集中,kitchen出现的概率是大于arboretum的,那么条件概率也应该有相同的判断。而且也不能保证在以后的语料库不会出现in the这个词
为解决这一问题,提出interpolation
在使用Trigram LM时,要同时去考虑Unigram和Bigram中的出现的频次
在这里插入图片描述
在这里插入图片描述
综合考虑LM ,给Unigram,Bigram,Trigram进行一个加权,三个都要考虑到
但是要保证权重和为1

平滑方法四:good-turning soomthing

在这里插入图片描述
Nc :表示出现c次的单词个数
在这里插入图片描述
在这里插入图片描述
下表前两列表示统计一个词典库中单词数量从0-出现20次的单词个数,
第三列是根据good-turning来计算的一个单词出现的概率
第四列是在实际的测试集中统计的单词出现概率,会发现使用good-turning推测的概率和实际概率很接近。
说明这种平滑方法的实用性
在这里插入图片描述
这种方法存在一个问题:在计算出现c次单词再出现的概率时,依赖于于出现c+1次单词的概率,但是如果没有后一项或者说后一项出现c+1次单词的个数是0,那么前一项计算结果概率就成了0.
所以这里我们会使用线性回归的方式确定一条平滑的曲线,这样那些出现N个单词的个数也就有一个值来对应。
在这里插入图片描述

这篇关于NLP学习06_评估语言模型smoothing的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/888191

相关文章

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

C语言中位操作的实际应用举例

《C语言中位操作的实际应用举例》:本文主要介绍C语言中位操作的实际应用,总结了位操作的使用场景,并指出了需要注意的问题,如可读性、平台依赖性和溢出风险,文中通过代码介绍的非常详细,需要的朋友可以参... 目录1. 嵌入式系统与硬件寄存器操作2. 网络协议解析3. 图像处理与颜色编码4. 高效处理布尔标志集合

Go语言开发实现查询IP信息的MCP服务器

《Go语言开发实现查询IP信息的MCP服务器》随着MCP的快速普及和广泛应用,MCP服务器也层出不穷,本文将详细介绍如何在Go语言中使用go-mcp库来开发一个查询IP信息的MCP... 目录前言mcp-ip-geo 服务器目录结构说明查询 IP 信息功能实现工具实现工具管理查询单个 IP 信息工具的实现服

Python Transformers库(NLP处理库)案例代码讲解

《PythonTransformers库(NLP处理库)案例代码讲解》本文介绍transformers库的全面讲解,包含基础知识、高级用法、案例代码及学习路径,内容经过组织,适合不同阶段的学习者,对... 目录一、基础知识1. Transformers 库简介2. 安装与环境配置3. 快速上手示例二、核心模

C 语言中enum枚举的定义和使用小结

《C语言中enum枚举的定义和使用小结》在C语言里,enum(枚举)是一种用户自定义的数据类型,它能够让你创建一组具名的整数常量,下面我会从定义、使用、特性等方面详细介绍enum,感兴趣的朋友一起看... 目录1、引言2、基本定义3、定义枚举变量4、自定义枚举常量的值5、枚举与switch语句结合使用6、枚

Go 语言中的select语句详解及工作原理

《Go语言中的select语句详解及工作原理》在Go语言中,select语句是用于处理多个通道(channel)操作的一种控制结构,它类似于switch语句,本文给大家介绍Go语言中的select语... 目录Go 语言中的 select 是做什么的基本功能语法工作原理示例示例 1:监听多个通道示例 2:带

C语言函数递归实际应用举例详解

《C语言函数递归实际应用举例详解》程序调用自身的编程技巧称为递归,递归做为一种算法在程序设计语言中广泛应用,:本文主要介绍C语言函数递归实际应用举例的相关资料,文中通过代码介绍的非常详细,需要的朋... 目录前言一、递归的概念与思想二、递归的限制条件 三、递归的实际应用举例(一)求 n 的阶乘(二)顺序打印

Spring Security基于数据库的ABAC属性权限模型实战开发教程

《SpringSecurity基于数据库的ABAC属性权限模型实战开发教程》:本文主要介绍SpringSecurity基于数据库的ABAC属性权限模型实战开发教程,本文给大家介绍的非常详细,对大... 目录1. 前言2. 权限决策依据RBACABAC综合对比3. 数据库表结构说明4. 实战开始5. MyBA

Java的IO模型、Netty原理解析

《Java的IO模型、Netty原理解析》Java的I/O是以流的方式进行数据输入输出的,Java的类库涉及很多领域的IO内容:标准的输入输出,文件的操作、网络上的数据传输流、字符串流、对象流等,这篇... 目录1.什么是IO2.同步与异步、阻塞与非阻塞3.三种IO模型BIO(blocking I/O)NI

基于Flask框架添加多个AI模型的API并进行交互

《基于Flask框架添加多个AI模型的API并进行交互》:本文主要介绍如何基于Flask框架开发AI模型API管理系统,允许用户添加、删除不同AI模型的API密钥,感兴趣的可以了解下... 目录1. 概述2. 后端代码说明2.1 依赖库导入2.2 应用初始化2.3 API 存储字典2.4 路由函数2.5 应