python实现拼写检查器(唐宇迪机器学习实战视频)

2024-06-08 13:08

本文主要是介绍python实现拼写检查器(唐宇迪机器学习实战视频),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

简易拼写检查器

原理

根据朴素贝叶斯实现。

贝叶斯公式:  p(c|x)=p(c)*p(x|c)/p(x)

h代表猜测的要输入的单词 D实际输入的单词

p(h|D)=p(h)*p(D|h)/p(D)

p(D)可以不考虑,因为每次输入的单词和结果没有关系。

p(h|D)根p(h)和p(D|h)有关

p(h)先验概率(词频)

p(D|h)根据键盘上距离的来定

代码实现

需要导入

import re,collections
  1. 需要读取一个big.txt文本作为词库(只是几篇英文的文章)
    # 把单词抽取出来,转化成小写,并且去除特殊符号
    def words(text): return re.findall('[a-z]+',text.lower())
    def train(features):model=collections.defaultdict(lambda :1)for f in features:model[f]+=1return model
    NWORDS=train(words(open("big.txt").read()))

    lambda的意思是:设置出现的最小出现的次数为1。这样输入新的单词先验概率不为0,如果为先验概率不为0的话,输入新单词就永远不可能出现。

  2. 计算p(D|h) (只经一次变化就是单词距离为1)

    alphabet="abcdefghijklmnopqrstuvwxyz"
    #返回所有与单词距离为1 的集合
    def edits1(word):n=len(word)return set([word[0:i]+word[i+1:] for i in range(n)]+[word[0:i]+word[i+1]+word[i]+word[i+2:] for i in range(n-1)]+[word[0:i]+c+word[i+1:] for i in range(n) for c in alphabet]+[word[0:i] + c + word[i:] for i in range(n+1) for c in alphabet]     #增删改等操作)  
    #返回所有距离为2的集合
    #只返回正确的单词
    def deits2(word):return set(e2 for e1 in edits1(word) for e2 in edits1(e1) if e2 in NWORDS)
    

     

  3. 设置优先级,最后返回概率最大的单词

    def known(words): return set(w for w in words if w in NWORDS)
    def correct(word):candiates=known([word]) or known(edits1(word)) or deits2(word) or [word]return max(candiates,key=lambda w: NWORDS[w])

     

测试效果:

a=correct("appla")
print a

输入appla

整体代码:

# -*- coding: UTF-8 -*-
import re,collections
# 把单词抽取出来,转化成小写,并且去除特殊符号
def words(text): return re.findall('[a-z]+',text.lower())
def train(features):model=collections.defaultdict(lambda :1)for f in features:model[f]+=1return model
NWORDS=train(words(open("big.txt").read()))alphabet="abcdefghijklmnopqrstuvwxyz"
#返回所有与单词距离为1 的集合
def edits1(word):n=len(word)return set([word[0:i]+word[i+1:] for i in range(n)]+[word[0:i]+word[i+1]+word[i]+word[i+2:] for i in range(n-1)]+[word[0:i]+c+word[i+1:] for i in range(n) for c in alphabet]+[word[0:i] + c + word[i:] for i in range(n+1) for c in alphabet])
#返回所有距离为2的集合
#只返回正确的单词
def deits2(word):return set(e2 for e1 in edits1(word) for e2 in edits1(e1) if e2 in NWORDS)
def known(words): return set(w for w in words if w in NWORDS)
def correct(word):candiates=known([word]) or known(edits1(word)) or deits2(word) or [word]return max(candiates,key=lambda w: NWORDS[w])
a=correct("appla")
print a

 

这篇关于python实现拼写检查器(唐宇迪机器学习实战视频)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1042271

相关文章

Qt把文件夹从A移动到B的实现示例

《Qt把文件夹从A移动到B的实现示例》本文主要介绍了Qt把文件夹从A移动到B的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学... 目录如何移动一个文件? 如何移动文件夹(包含里面的全部内容):如何删除文件夹:QT 文件复制,移动(

Flask 验证码自动生成的实现示例

《Flask验证码自动生成的实现示例》本文主要介绍了Flask验证码自动生成的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习... 目录生成图片以及结果处理验证码蓝图html页面展示想必验证码大家都有所了解,但是可以自己定义图片验证码

VSCode配置Anaconda Python环境的实现

《VSCode配置AnacondaPython环境的实现》VisualStudioCode中可以使用Anaconda环境进行Python开发,本文主要介绍了VSCode配置AnacondaPytho... 目录前言一、安装 Visual Studio Code 和 Anaconda二、创建或激活 conda

使用mvn deploy命令上传jar包的实现

《使用mvndeploy命令上传jar包的实现》本文介绍了使用mvndeploy:deploy-file命令将本地仓库中的JAR包重新发布到Maven私服,文中通过示例代码介绍的非常详细,对大家的学... 目录一、背景二、环境三、配置nexus上传账号四、执行deploy命令上传包1. 首先需要把本地仓中要

pytorch+torchvision+python版本对应及环境安装

《pytorch+torchvision+python版本对应及环境安装》本文主要介绍了pytorch+torchvision+python版本对应及环境安装,安装过程中需要注意Numpy版本的降级,... 目录一、版本对应二、安装命令(pip)1. 版本2. 安装全过程3. 命令相关解释参考文章一、版本对

JAVA封装多线程实现的方式及原理

《JAVA封装多线程实现的方式及原理》:本文主要介绍Java中封装多线程的原理和常见方式,通过封装可以简化多线程的使用,提高安全性,并增强代码的可维护性和可扩展性,需要的朋友可以参考下... 目录前言一、封装的目标二、常见的封装方式及原理总结前言在 Java 中,封装多线程的原理主要围绕着将多线程相关的操

MySQL中实现多表查询的操作方法(配sql+实操图+案例巩固 通俗易懂版)

《MySQL中实现多表查询的操作方法(配sql+实操图+案例巩固通俗易懂版)》本文主要讲解了MySQL中的多表查询,包括子查询、笛卡尔积、自连接、多表查询的实现方法以及多列子查询等,通过实际例子和操... 目录复合查询1. 回顾查询基本操作group by 分组having1. 显示部门号为10的部门名,员

Java进阶学习之如何开启远程调式

《Java进阶学习之如何开启远程调式》Java开发中的远程调试是一项至关重要的技能,特别是在处理生产环境的问题或者协作开发时,:本文主要介绍Java进阶学习之如何开启远程调式的相关资料,需要的朋友... 目录概述Java远程调试的开启与底层原理开启Java远程调试底层原理JVM参数总结&nbsMbKKXJx

java导出pdf文件的详细实现方法

《java导出pdf文件的详细实现方法》:本文主要介绍java导出pdf文件的详细实现方法,包括制作模板、获取中文字体文件、实现后端服务以及前端发起请求并生成下载链接,需要的朋友可以参考下... 目录使用注意点包含内容1、制作pdf模板2、获取pdf导出中文需要的文件3、实现4、前端发起请求并生成下载链接使

Java的volatile和sychronized底层实现原理解析

《Java的volatile和sychronized底层实现原理解析》文章详细介绍了Java中的synchronized和volatile关键字的底层实现原理,包括字节码层面、JVM层面的实现细节,以... 目录1. 概览2. Synchronized2.1 字节码层面2.2 JVM层面2.2.1 ente