协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现

本文主要是介绍协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

    • 相关算法介绍
      • 余弦相似度
      • 皮尔逊(Pearson)相关系数
    • 使用协同过滤推荐算法对用户进行评分预测
      • 协同过滤推荐算法数据集
      • 关于用户-物品评分矩阵
      • 代码及实现
      • 如何计算评分预测?
      • 总结

相关算法介绍

余弦相似度

  • 度量的是两个向量之间的夹角, 用夹角的余弦值来度量相似的情况
  • 两个向量的夹角为0是,余弦值为1, 当夹角为90度是余弦值为0,为180度是余弦值为-1
  • 余弦相似度在度量文本相似度, 用户相似度 物品相似度的时候较为常用
  • 余弦相似度的特点, 与向量长度无关,余弦相似度计算要对向量长度归一化, 两个向量只要方向一致,无论程度强弱, 都可以视为’相似’
    在这里插入图片描述

皮尔逊(Pearson)相关系数

  • 实际上也是一种余弦相似度, 不过先对向量做了中心化, 向量a b 各自减去向量的均值后, 再计算余弦相似度
  • 皮尔逊相似度计算结果在-1,1之间 -1表示负相关, 1表示正相关
  • 度量两个变量是不是同增同减
  • 皮尔逊相关系数度量的是两个变量的变化趋势是否一致, 不适合计算布尔值向量之间的相关度
    在这里插入图片描述

使用协同过滤推荐算法对用户进行评分预测

协同过滤推荐算法数据集

  • 在上次通过Jaccard相似度计算,我们只是创建了用户对物品的一个购买记录,也可以是浏览点击记录、收听记录等等。这样数据我们预测的结果主要是预测用户是否对某物品感兴趣,对于这件物品的喜好程度却不能很好的预测。

  • 因此在协同过滤推荐算法中其实会更多的利用用户对某种物品的“评分”数据来进行预测,通过评分数据集,我们可以预测用户对于他没有评分过的物品进行评分。实现原理和思想和都是一样的,只是使用的数据集是用户-物品的评分数据。

关于用户-物品评分矩阵

  • 用户-物品的评分矩阵,根据评分矩阵的稀疏程度会有不同的解决方案,一般有两种情形:
  1. 稠密评分矩阵
    在这里插入图片描述

  2. 稀疏评分矩阵
    在这里插入图片描述

代码及实现

  • 构建数据集
import pandas as pd
import numpy as npusers = ["Thomas", "Cauchy", "Alice", "Bob", "Alex"]
items = ["iPad", "MacBook", "iPhone", "iWatch", "AirPods"]
#用户购买记录数据集
#构建评分数据时,对于缺失的部分我们需要保留为None,如果设置为0那么会被当作评分值为0去对待
datasets = [[5,3,4,4,None],[3,1,2,3,3],[4,3,4,3,5],[3,3,1,5,4],[1,5,5,2,1],
]
  • 计算相似度
#对于评分数据这里我们采用皮尔逊相关系数[-1,1]来计算,-1表示强负相关,+1表示强正相关。 pandas中corr方法可直接用于计算皮尔逊相关系数
df = pd.DataFrame(datasets,columns=items,index=users)print("用户之间的两两相似度:")# 默认是按列进行计算,因此如果计算用户间的相似度,当前需要进行转置
user_similar = df.T.corr()
print(user_similar.round(4))print("物品之间的两两相似度:")
item_similar = df.corr()
print(item_similar.round(4))

在这里插入图片描述
Tips:我们在做预测评分时,往往是通过与其有正相关的用户或物品进行预测,如果不存在正相关的情况,那么将无法做出预测。在稀疏矩阵中尤为常见,因为稀疏评分矩阵中很难得出正相关系数。

如何计算评分预测?

  1. User-Based CF 评分预测:使用用户间的相似度进行预测
    用户本身的评分评分以及近邻用户的加权平均相似度打分来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与Thomas最近邻的Cauchy和Alice进行预测,计算如下:
    在这里插入图片描述
  2. Item-Based CF 评分预测:使用物品间的相似度进行预测
    结合预测物品与相似物品的加权平均相似度打分进行来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与AirPods最近邻的iPad和iWatch进行预测,计算如下:
    在这里插入图片描述

总结

User-Based CF预测评分和Item-Based CF的评分结果会存在差异,主要原因是他们其实是属于两种不同的推荐算法,各自在不同的领域与不同场景下,都会比另一种的效果更佳。如果是哪种是最佳评分,必须进行合理的效果评估,因此在实现推荐系统时这两种算法往往都是需要去实现的,然后对产生的推荐效果进行评估分析选出更优方案。

这篇关于协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/739273

相关文章

python使用watchdog实现文件资源监控

《python使用watchdog实现文件资源监控》watchdog支持跨平台文件资源监控,可以检测指定文件夹下文件及文件夹变动,下面我们来看看Python如何使用watchdog实现文件资源监控吧... python文件监控库watchdogs简介随着Python在各种应用领域中的广泛使用,其生态环境也

el-select下拉选择缓存的实现

《el-select下拉选择缓存的实现》本文主要介绍了在使用el-select实现下拉选择缓存时遇到的问题及解决方案,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的... 目录项目场景:问题描述解决方案:项目场景:从左侧列表中选取字段填入右侧下拉多选框,用户可以对右侧

SpringCloud集成AlloyDB的示例代码

《SpringCloud集成AlloyDB的示例代码》AlloyDB是GoogleCloud提供的一种高度可扩展、强性能的关系型数据库服务,它兼容PostgreSQL,并提供了更快的查询性能... 目录1.AlloyDBjavascript是什么?AlloyDB 的工作原理2.搭建测试环境3.代码工程1.

Java调用Python代码的几种方法小结

《Java调用Python代码的几种方法小结》Python语言有丰富的系统管理、数据处理、统计类软件包,因此从java应用中调用Python代码的需求很常见、实用,本文介绍几种方法从java调用Pyt... 目录引言Java core使用ProcessBuilder使用Java脚本引擎总结引言python

Java中ArrayList的8种浅拷贝方式示例代码

《Java中ArrayList的8种浅拷贝方式示例代码》:本文主要介绍Java中ArrayList的8种浅拷贝方式的相关资料,讲解了Java中ArrayList的浅拷贝概念,并详细分享了八种实现浅... 目录引言什么是浅拷贝?ArrayList 浅拷贝的重要性方法一:使用构造函数方法二:使用 addAll(

Python pyinstaller实现图形化打包工具

《Pythonpyinstaller实现图形化打包工具》:本文主要介绍一个使用PythonPYQT5制作的关于pyinstaller打包工具,代替传统的cmd黑窗口模式打包页面,实现更快捷方便的... 目录1.简介2.运行效果3.相关源码1.简介一个使用python PYQT5制作的关于pyinstall

使用Python实现大文件切片上传及断点续传的方法

《使用Python实现大文件切片上传及断点续传的方法》本文介绍了使用Python实现大文件切片上传及断点续传的方法,包括功能模块划分(获取上传文件接口状态、临时文件夹状态信息、切片上传、切片合并)、整... 目录概要整体架构流程技术细节获取上传文件状态接口获取临时文件夹状态信息接口切片上传功能文件合并功能小

python实现自动登录12306自动抢票功能

《python实现自动登录12306自动抢票功能》随着互联网技术的发展,越来越多的人选择通过网络平台购票,特别是在中国,12306作为官方火车票预订平台,承担了巨大的访问量,对于热门线路或者节假日出行... 目录一、遇到的问题?二、改进三、进阶–展望总结一、遇到的问题?1.url-正确的表头:就是首先ur

C#实现文件读写到SQLite数据库

《C#实现文件读写到SQLite数据库》这篇文章主要为大家详细介绍了使用C#将文件读写到SQLite数据库的几种方法,文中的示例代码讲解详细,感兴趣的小伙伴可以参考一下... 目录1. 使用 BLOB 存储文件2. 存储文件路径3. 分块存储文件《文件读写到SQLite数据库China编程的方法》博客中,介绍了文

Redis主从复制实现原理分析

《Redis主从复制实现原理分析》Redis主从复制通过Sync和CommandPropagate阶段实现数据同步,2.8版本后引入Psync指令,根据复制偏移量进行全量或部分同步,优化了数据传输效率... 目录Redis主DodMIK从复制实现原理实现原理Psync: 2.8版本后总结Redis主从复制实