协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现

本文主要是介绍协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

    • 相关算法介绍
      • 余弦相似度
      • 皮尔逊(Pearson)相关系数
    • 使用协同过滤推荐算法对用户进行评分预测
      • 协同过滤推荐算法数据集
      • 关于用户-物品评分矩阵
      • 代码及实现
      • 如何计算评分预测?
      • 总结

相关算法介绍

余弦相似度

  • 度量的是两个向量之间的夹角, 用夹角的余弦值来度量相似的情况
  • 两个向量的夹角为0是,余弦值为1, 当夹角为90度是余弦值为0,为180度是余弦值为-1
  • 余弦相似度在度量文本相似度, 用户相似度 物品相似度的时候较为常用
  • 余弦相似度的特点, 与向量长度无关,余弦相似度计算要对向量长度归一化, 两个向量只要方向一致,无论程度强弱, 都可以视为’相似’
    在这里插入图片描述

皮尔逊(Pearson)相关系数

  • 实际上也是一种余弦相似度, 不过先对向量做了中心化, 向量a b 各自减去向量的均值后, 再计算余弦相似度
  • 皮尔逊相似度计算结果在-1,1之间 -1表示负相关, 1表示正相关
  • 度量两个变量是不是同增同减
  • 皮尔逊相关系数度量的是两个变量的变化趋势是否一致, 不适合计算布尔值向量之间的相关度
    在这里插入图片描述

使用协同过滤推荐算法对用户进行评分预测

协同过滤推荐算法数据集

  • 在上次通过Jaccard相似度计算,我们只是创建了用户对物品的一个购买记录,也可以是浏览点击记录、收听记录等等。这样数据我们预测的结果主要是预测用户是否对某物品感兴趣,对于这件物品的喜好程度却不能很好的预测。

  • 因此在协同过滤推荐算法中其实会更多的利用用户对某种物品的“评分”数据来进行预测,通过评分数据集,我们可以预测用户对于他没有评分过的物品进行评分。实现原理和思想和都是一样的,只是使用的数据集是用户-物品的评分数据。

关于用户-物品评分矩阵

  • 用户-物品的评分矩阵,根据评分矩阵的稀疏程度会有不同的解决方案,一般有两种情形:
  1. 稠密评分矩阵
    在这里插入图片描述

  2. 稀疏评分矩阵
    在这里插入图片描述

代码及实现

  • 构建数据集
import pandas as pd
import numpy as npusers = ["Thomas", "Cauchy", "Alice", "Bob", "Alex"]
items = ["iPad", "MacBook", "iPhone", "iWatch", "AirPods"]
#用户购买记录数据集
#构建评分数据时,对于缺失的部分我们需要保留为None,如果设置为0那么会被当作评分值为0去对待
datasets = [[5,3,4,4,None],[3,1,2,3,3],[4,3,4,3,5],[3,3,1,5,4],[1,5,5,2,1],
]
  • 计算相似度
#对于评分数据这里我们采用皮尔逊相关系数[-1,1]来计算,-1表示强负相关,+1表示强正相关。 pandas中corr方法可直接用于计算皮尔逊相关系数
df = pd.DataFrame(datasets,columns=items,index=users)print("用户之间的两两相似度:")# 默认是按列进行计算,因此如果计算用户间的相似度,当前需要进行转置
user_similar = df.T.corr()
print(user_similar.round(4))print("物品之间的两两相似度:")
item_similar = df.corr()
print(item_similar.round(4))

在这里插入图片描述
Tips:我们在做预测评分时,往往是通过与其有正相关的用户或物品进行预测,如果不存在正相关的情况,那么将无法做出预测。在稀疏矩阵中尤为常见,因为稀疏评分矩阵中很难得出正相关系数。

如何计算评分预测?

  1. User-Based CF 评分预测:使用用户间的相似度进行预测
    用户本身的评分评分以及近邻用户的加权平均相似度打分来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与Thomas最近邻的Cauchy和Alice进行预测,计算如下:
    在这里插入图片描述
  2. Item-Based CF 评分预测:使用物品间的相似度进行预测
    结合预测物品与相似物品的加权平均相似度打分进行来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与AirPods最近邻的iPad和iWatch进行预测,计算如下:
    在这里插入图片描述

总结

User-Based CF预测评分和Item-Based CF的评分结果会存在差异,主要原因是他们其实是属于两种不同的推荐算法,各自在不同的领域与不同场景下,都会比另一种的效果更佳。如果是哪种是最佳评分,必须进行合理的效果评估,因此在实现推荐系统时这两种算法往往都是需要去实现的,然后对产生的推荐效果进行评估分析选出更优方案。

这篇关于协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/739273

相关文章

使用Sentinel自定义返回和实现区分来源方式

《使用Sentinel自定义返回和实现区分来源方式》:本文主要介绍使用Sentinel自定义返回和实现区分来源方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录Sentinel自定义返回和实现区分来源1. 自定义错误返回2. 实现区分来源总结Sentinel自定

Java实现时间与字符串互相转换详解

《Java实现时间与字符串互相转换详解》这篇文章主要为大家详细介绍了Java中实现时间与字符串互相转换的相关方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、日期格式化为字符串(一)使用预定义格式(二)自定义格式二、字符串解析为日期(一)解析ISO格式字符串(二)解析自定义

opencv图像处理之指纹验证的实现

《opencv图像处理之指纹验证的实现》本文主要介绍了opencv图像处理之指纹验证的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学... 目录一、简介二、具体案例实现1. 图像显示函数2. 指纹验证函数3. 主函数4、运行结果三、总结一、

SpringIntegration消息路由之Router的条件路由与过滤功能

《SpringIntegration消息路由之Router的条件路由与过滤功能》本文详细介绍了Router的基础概念、条件路由实现、基于消息头的路由、动态路由与路由表、消息过滤与选择性路由以及错误处理... 目录引言一、Router基础概念二、条件路由实现三、基于消息头的路由四、动态路由与路由表五、消息过滤

Springboot处理跨域的实现方式(附Demo)

《Springboot处理跨域的实现方式(附Demo)》:本文主要介绍Springboot处理跨域的实现方式(附Demo),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不... 目录Springboot处理跨域的方式1. 基本知识2. @CrossOrigin3. 全局跨域设置4.

Spring Boot 3.4.3 基于 Spring WebFlux 实现 SSE 功能(代码示例)

《SpringBoot3.4.3基于SpringWebFlux实现SSE功能(代码示例)》SpringBoot3.4.3结合SpringWebFlux实现SSE功能,为实时数据推送提供... 目录1. SSE 简介1.1 什么是 SSE?1.2 SSE 的优点1.3 适用场景2. Spring WebFlu

基于SpringBoot实现文件秒传功能

《基于SpringBoot实现文件秒传功能》在开发Web应用时,文件上传是一个常见需求,然而,当用户需要上传大文件或相同文件多次时,会造成带宽浪费和服务器存储冗余,此时可以使用文件秒传技术通过识别重复... 目录前言文件秒传原理代码实现1. 创建项目基础结构2. 创建上传存储代码3. 创建Result类4.

SpringBoot日志配置SLF4J和Logback的方法实现

《SpringBoot日志配置SLF4J和Logback的方法实现》日志记录是不可或缺的一部分,本文主要介绍了SpringBoot日志配置SLF4J和Logback的方法实现,文中通过示例代码介绍的非... 目录一、前言二、案例一:初识日志三、案例二:使用Lombok输出日志四、案例三:配置Logback一

java之Objects.nonNull用法代码解读

《java之Objects.nonNull用法代码解读》:本文主要介绍java之Objects.nonNull用法代码,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐... 目录Java之Objects.nonwww.chinasem.cnNull用法代码Objects.nonN

Python如何使用__slots__实现节省内存和性能优化

《Python如何使用__slots__实现节省内存和性能优化》你有想过,一个小小的__slots__能让你的Python类内存消耗直接减半吗,没错,今天咱们要聊的就是这个让人眼前一亮的技巧,感兴趣的... 目录背景:内存吃得满满的类__slots__:你的内存管理小助手举个大概的例子:看看效果如何?1.