【java、lucene、python】互联网搜索引擎课程报告二:建立搜索引擎

2024-06-10 06:36

本文主要是介绍【java、lucene、python】互联网搜索引擎课程报告二:建立搜索引擎,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、项目要求

  1. 建立并实现文本搜索功能
  1. 对经过预处理后的500个英文和中文文档/网页建立搜索并实现搜索功能
  2. 对文档建立索引,然后通过前台界面或者已提供的界面,输入关键字,展示搜索结果
  3. 前台可通过网页形式、应用程序形式、或者利用已有的界面工具显示
  4. 实现英文搜索及中文搜索功能
  1. 比较文档之间的相似度

通过余弦距离计算任意两个文档之间的相似度,列出文档原文,并给出相似

度值。

  1. 对下载的文档,利用K-Means聚类算法进行聚类
  1. 将下载的500个中文/英文文档聚为20个类,并显示聚类之后所形成的三个最大的类,及每个类中代表性的文档(即,离类中心最近的五个文档)
  2. 距离计算公式,可采用余弦距离,也可用欧式距离

二、开发环境

系统:windows 10 

开发语言:JAVA,python

开发工具:IDEA,pycharm

三、项目实现

  使用开源搜索引擎Lucene对经过预处理后的500个英文和中文文档建立索引,并实现搜索功能,然后通过前台界面,输入关键字,展示搜索结果。支持英文搜索及中文搜索功能。

一、搜索引擎

1.建立索引

建立索引时,使用IK Analyzer分词器,每个文档(document)有三个域,content对应文档内容,fileName对应文档名,filePath对应文档路径。

2.搜索

由于用Luke进行搜索时不能使用IK Analyzer分词器,中文只能单字分词,搜索结果不准确。故自行编码实现搜索功能,前台界面利用JAVA的awt库进行设计。因为只实现搜索功能,前台界面设计得比较简单,居中的上方是关键词输入框,下方依次是选择检索中文还是英文文档的单选框和搜索结果文本显示框。输入关键词后,按下回车,就会显示搜索结果,第一行是搜索到的文档数。

二、比较文档之间的相似度

通过余弦距离(Cosine Distance)计算任意两个文档之间的相似度,列出文档原文,并给出相似度值。

计算文本相似度的思路:1、分词;2、列出所有的词;3、计算词频;4、向量化;5、用公式计算相似度(余弦值)。余弦值接近1,夹角趋于0,表明两个向量越相似,余弦值接近于0,夹角趋于90度,表明两个向量越不相似。

前台界面利用JAVA的awt库进行设计。分别输入两个文档的编号,回车后下方的两个文本区域会显示文档的内容。下方的单选框可以选择比较中文还是英文文档。点击下方的calculate the similarity的按钮,按钮上方的文本框会显示相似度值。

三、利用K-Means聚类算法进行聚类

利用K-Means聚类算法进行聚类将下载的500个中文/英文文档聚为20个类,并显示聚类之后所形成的三个最大的类,及每个类中代表性的文档(即,离类中心最近的五个文档)。将文档分别聚类成不同数量的类,如:5、10、25、50等,比较聚类结果的异同与变化。

K-Means聚类算法的前几个步骤与计算文本相似度的思路的相似,即对文本分词、列出所有的词、计算词频、向量化,只是这里处理的文档不再是2个文档,而是500个文档(文档已经预处理过)。

然后给定一个数k,表示聚类的数目,随机选取k个样本作为初始的聚类中心。计算每个文档与k个聚类中心的距离(这里使用的余弦距离,值越接近1表示越接近),将每个文档分配给距离它最近的聚类中心。

接着,计算每个聚类中所有向量每个坐标的平均值,计算出一个“质心”,作为新的聚类中心。

最后,进行迭代,对每个文档重新计算距离并分配到最近的聚类。通过判断每个聚类中心有无变化,决定是否停止迭代。迭代结束时,可以得到k个聚类中心的值,每类中所有文档序号及对应余弦距离。根据这些信息,经过筛选和排序,可以找到形成的三个最大的类,及每个类中代表性的文档。

 上面为部分说明,完整报告请见:

参考

【黑马程序员Lucene全文检索技术,从底层到实战应用Lucene全套教程】 https://www.bilibili.com/video/BV1eJ411q7nw/?p=23&share_source=copy_web&vd_source=9332b8fc5ea8d349a54c3989f6189fd3

文档预处理:

前一个报告:

https://download.csdn.net/download/qq_61814350/89207414?spm=1001.2014.3001.5503

Lucene的api使用、环境搭建(最多看到前24个视频就可以,下载他提供的配套资料,很方便):

【黑马程序员Lucene全文检索技术,从底层到实战应用Lucene全套教程】

https://www.bilibili.com/video/BV1eJ411q7nw/?p=24&share_source=copy_web&vd_source=9332b8fc5ea8d349a54c3989f6189fd3

java界面设计(容器、按钮、输入框、事件监听,最多看到P13):

【【狂神说Java】GUI编程入门到游戏实战】

https://www.bilibili.com/video/BV1DJ411B75F/?share_source=copy_web&vd_source=9332b8fc5ea8d349a54c3989f6189fd3

余弦距离、TF-IDF:

https://blog.csdn.net/m0_37739193/article/details/119335260

https://blog.csdn.net/wxgxgp/article/details/104146034

https://blog.csdn.net/qq_63159704/article/details/132846060

kmeans理论讲解:

【k-means kmeans聚类算法 清晰解释(带算例)】

https://www.bilibili.com/video/BV1V44y1u7mJ/?share_source=copy_web&vd_source=9332b8fc5ea8d349a54c3989f6189fd3

kmeans代码实现:

https://www.cnblogs.com/zuixime0515/p/9604034.html

python、numpy:

哪里不会再查,看菜鸟教程。

java:

去除空格、标点符号

https://blog.csdn.net/chen134225/article/details/103104392

java- File类的常用方法:遍历目录里的文件

https://blog.csdn.net/u014217137/article/details/128044606

这篇关于【java、lucene、python】互联网搜索引擎课程报告二:建立搜索引擎的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1047434

相关文章

Python调用Orator ORM进行数据库操作

《Python调用OratorORM进行数据库操作》OratorORM是一个功能丰富且灵活的PythonORM库,旨在简化数据库操作,它支持多种数据库并提供了简洁且直观的API,下面我们就... 目录Orator ORM 主要特点安装使用示例总结Orator ORM 是一个功能丰富且灵活的 python O

Java实现检查多个时间段是否有重合

《Java实现检查多个时间段是否有重合》这篇文章主要为大家详细介绍了如何使用Java实现检查多个时间段是否有重合,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录流程概述步骤详解China编程步骤1:定义时间段类步骤2:添加时间段步骤3:检查时间段是否有重合步骤4:输出结果示例代码结语作

Java中String字符串使用避坑指南

《Java中String字符串使用避坑指南》Java中的String字符串是我们日常编程中用得最多的类之一,看似简单的String使用,却隐藏着不少“坑”,如果不注意,可能会导致性能问题、意外的错误容... 目录8个避坑点如下:1. 字符串的不可变性:每次修改都创建新对象2. 使用 == 比较字符串,陷阱满

Java判断多个时间段是否重合的方法小结

《Java判断多个时间段是否重合的方法小结》这篇文章主要为大家详细介绍了Java中判断多个时间段是否重合的方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录判断多个时间段是否有间隔判断时间段集合是否与某时间段重合判断多个时间段是否有间隔实体类内容public class D

Python使用国内镜像加速pip安装的方法讲解

《Python使用国内镜像加速pip安装的方法讲解》在Python开发中,pip是一个非常重要的工具,用于安装和管理Python的第三方库,然而,在国内使用pip安装依赖时,往往会因为网络问题而导致速... 目录一、pip 工具简介1. 什么是 pip?2. 什么是 -i 参数?二、国内镜像源的选择三、如何

IDEA编译报错“java: 常量字符串过长”的原因及解决方法

《IDEA编译报错“java:常量字符串过长”的原因及解决方法》今天在开发过程中,由于尝试将一个文件的Base64字符串设置为常量,结果导致IDEA编译的时候出现了如下报错java:常量字符串过长,... 目录一、问题描述二、问题原因2.1 理论角度2.2 源码角度三、解决方案解决方案①:StringBui

Java覆盖第三方jar包中的某一个类的实现方法

《Java覆盖第三方jar包中的某一个类的实现方法》在我们日常的开发中,经常需要使用第三方的jar包,有时候我们会发现第三方的jar包中的某一个类有问题,或者我们需要定制化修改其中的逻辑,那么应该如何... 目录一、需求描述二、示例描述三、操作步骤四、验证结果五、实现原理一、需求描述需求描述如下:需要在

Java中ArrayList和LinkedList有什么区别举例详解

《Java中ArrayList和LinkedList有什么区别举例详解》:本文主要介绍Java中ArrayList和LinkedList区别的相关资料,包括数据结构特性、核心操作性能、内存与GC影... 目录一、底层数据结构二、核心操作性能对比三、内存与 GC 影响四、扩容机制五、线程安全与并发方案六、工程

JavaScript中的reduce方法执行过程、使用场景及进阶用法

《JavaScript中的reduce方法执行过程、使用场景及进阶用法》:本文主要介绍JavaScript中的reduce方法执行过程、使用场景及进阶用法的相关资料,reduce是JavaScri... 目录1. 什么是reduce2. reduce语法2.1 语法2.2 参数说明3. reduce执行过程

如何使用Java实现请求deepseek

《如何使用Java实现请求deepseek》这篇文章主要为大家详细介绍了如何使用Java实现请求deepseek功能,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录1.deepseek的api创建2.Java实现请求deepseek2.1 pom文件2.2 json转化文件2.2