使用tf*idf实现对文档集合的检索

2024-06-23 06:58

本文主要是介绍使用tf*idf实现对文档集合的检索,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

步骤:

  1. 读取三篇文档1.txt,2.txt,3.txt,里边的内容分别为“this is php”,“this is html html”,“this is java”

  2. 分词,并统计词频tf

  3. 计算文档频率df

  4. 计算每篇文档的特征向量

  5. 计算搜索词与文档的夹角余弦值

    <?php$_txts = array('1.txt','2.txt','3.txt');$_len = count($_txts);for ($i = 0;$i < $_len;$i++){$_contents[] = file_get_contents($_txts[$i]);   //读取内容}for ($i = 0;$i < $_len;$i++){//分词$_words[] = explode(' ',trim($_contents[$i]));foreach ($_words[$i] as $_key=>$_value){$_value = trim($_value);$_value = preg_replace('/[.|,|(|)|-|;]/','',$_value);$_words[$i][$_key]=strtolower($_value);}//统计文档所有词的长度,一般计算tf需要除以这个值,为了简便,本次试验省去这步//$_words_count[]=count($_words[$i]);//词频tf$_tf[] = array_count_values($_words[$i]);//去重$_words[$i]= array_unique($_words[$i]);} //合并$_words_com = array_merge($_words[0],$_words[1],$_words[2]);//文档频率$_df = array_count_values($_words_com);//特征向量for ($i = 0;$i < $_len;$i++){//初始化,与文档频率的维度相同$_vsm[$i] = $_df;//把每个维度的值设置为0foreach($_vsm[$i] as $_key=>$_value){$_vsm[$i][$_key] = 0;}for ($j=0;$j<count($_words[$i]);$j++){if (in_array($_words[$i][$j],$_words_com)){$_vsm[$i][($_words[$i][$j])] = ($_tf[$i][($_words[$i][$j])])*(log($_len/$_df[($_words[$i][$j])]));} }} for($i = 0;$i < count($_vsm); $i++){echo '第'.($i+1).'篇文档的特征向量: ('. implode(",",$_vsm[$i]).')<br/>';}//测试$_query = 'java';$_vsm_que = $_df;foreach($_vsm_que as $_key=>$_value){$_vsm_que[$_key] = 0;}if (in_array($_query,$_vsm_que)){$_vsm_que[$_query] = 1;}for ($i = 0; $i < count($_vsm); $i++){foreach($_vsm_que as $_key=>$_value){$_sim[$i] += ($_vsm[$i][$_key]) * ($_vsm_que[$_key]);$_w1 += pow($_vsm_que[$_key],2);$_w2 += pow($_vsm[$i][$_key],2);}//求夹角余弦值,相似度计算$_cos[$i] = $_sim[$i]/(sqrt($_w1)*sqrt($_w2));echo '<br/>';echo '第'.($i+1).'篇文档的相似度:'.$_cos[$i];}arsort($_cos);foreach($_cos as $_key=>$_value){echo '<br/><br/>';echo '最符合的结果为第'.($_key+1).'篇文档';break;}
    ?>

    在浏览器运行的结果:


    第1篇文档的特征向量: (0,0,1.09861228867,0,0)
    第2篇文档的特征向量: (0,0,0,2.19722457734,0)
    第3篇文档的特征向量: (0,0,0,0,1.09861228867)

    第1篇文档的相似度:0
    第2篇文档的相似度:0
    第3篇文档的相似度:0.235702260396

    最符合的结果为第3篇文档


这篇关于使用tf*idf实现对文档集合的检索的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1086452

相关文章

Pandas使用SQLite3实战

《Pandas使用SQLite3实战》本文主要介绍了Pandas使用SQLite3实战,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学... 目录1 环境准备2 从 SQLite3VlfrWQzgt 读取数据到 DataFrame基础用法:读

JSON Web Token在登陆中的使用过程

《JSONWebToken在登陆中的使用过程》:本文主要介绍JSONWebToken在登陆中的使用过程,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录JWT 介绍微服务架构中的 JWT 使用结合微服务网关的 JWT 验证1. 用户登录,生成 JWT2. 自定义过滤

Java中StopWatch的使用示例详解

《Java中StopWatch的使用示例详解》stopWatch是org.springframework.util包下的一个工具类,使用它可直观的输出代码执行耗时,以及执行时间百分比,这篇文章主要介绍... 目录stopWatch 是org.springframework.util 包下的一个工具类,使用它

Java实现时间与字符串互相转换详解

《Java实现时间与字符串互相转换详解》这篇文章主要为大家详细介绍了Java中实现时间与字符串互相转换的相关方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、日期格式化为字符串(一)使用预定义格式(二)自定义格式二、字符串解析为日期(一)解析ISO格式字符串(二)解析自定义

opencv图像处理之指纹验证的实现

《opencv图像处理之指纹验证的实现》本文主要介绍了opencv图像处理之指纹验证的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学... 目录一、简介二、具体案例实现1. 图像显示函数2. 指纹验证函数3. 主函数4、运行结果三、总结一、

Java使用Curator进行ZooKeeper操作的详细教程

《Java使用Curator进行ZooKeeper操作的详细教程》ApacheCurator是一个基于ZooKeeper的Java客户端库,它极大地简化了使用ZooKeeper的开发工作,在分布式系统... 目录1、简述2、核心功能2.1 CuratorFramework2.2 Recipes3、示例实践3

Springboot处理跨域的实现方式(附Demo)

《Springboot处理跨域的实现方式(附Demo)》:本文主要介绍Springboot处理跨域的实现方式(附Demo),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不... 目录Springboot处理跨域的方式1. 基本知识2. @CrossOrigin3. 全局跨域设置4.

springboot security使用jwt认证方式

《springbootsecurity使用jwt认证方式》:本文主要介绍springbootsecurity使用jwt认证方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录前言代码示例依赖定义mapper定义用户信息的实体beansecurity相关的类提供登录接口测试提供一

go中空接口的具体使用

《go中空接口的具体使用》空接口是一种特殊的接口类型,它不包含任何方法,本文主要介绍了go中空接口的具体使用,具有一定的参考价值,感兴趣的可以了解一下... 目录接口-空接口1. 什么是空接口?2. 如何使用空接口?第一,第二,第三,3. 空接口几个要注意的坑坑1:坑2:坑3:接口-空接口1. 什么是空接

Spring Boot 3.4.3 基于 Spring WebFlux 实现 SSE 功能(代码示例)

《SpringBoot3.4.3基于SpringWebFlux实现SSE功能(代码示例)》SpringBoot3.4.3结合SpringWebFlux实现SSE功能,为实时数据推送提供... 目录1. SSE 简介1.1 什么是 SSE?1.2 SSE 的优点1.3 适用场景2. Spring WebFlu