协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现

本文主要是介绍协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

    • 相关算法介绍
      • 余弦相似度
      • 皮尔逊(Pearson)相关系数
    • 使用协同过滤推荐算法对用户进行评分预测
      • 协同过滤推荐算法数据集
      • 关于用户-物品评分矩阵
      • 代码及实现
      • 如何计算评分预测?
      • 总结

相关算法介绍

余弦相似度

  • 度量的是两个向量之间的夹角, 用夹角的余弦值来度量相似的情况
  • 两个向量的夹角为0是,余弦值为1, 当夹角为90度是余弦值为0,为180度是余弦值为-1
  • 余弦相似度在度量文本相似度, 用户相似度 物品相似度的时候较为常用
  • 余弦相似度的特点, 与向量长度无关,余弦相似度计算要对向量长度归一化, 两个向量只要方向一致,无论程度强弱, 都可以视为’相似’
    在这里插入图片描述

皮尔逊(Pearson)相关系数

  • 实际上也是一种余弦相似度, 不过先对向量做了中心化, 向量a b 各自减去向量的均值后, 再计算余弦相似度
  • 皮尔逊相似度计算结果在-1,1之间 -1表示负相关, 1表示正相关
  • 度量两个变量是不是同增同减
  • 皮尔逊相关系数度量的是两个变量的变化趋势是否一致, 不适合计算布尔值向量之间的相关度
    在这里插入图片描述

使用协同过滤推荐算法对用户进行评分预测

协同过滤推荐算法数据集

  • 在上次通过Jaccard相似度计算,我们只是创建了用户对物品的一个购买记录,也可以是浏览点击记录、收听记录等等。这样数据我们预测的结果主要是预测用户是否对某物品感兴趣,对于这件物品的喜好程度却不能很好的预测。

  • 因此在协同过滤推荐算法中其实会更多的利用用户对某种物品的“评分”数据来进行预测,通过评分数据集,我们可以预测用户对于他没有评分过的物品进行评分。实现原理和思想和都是一样的,只是使用的数据集是用户-物品的评分数据。

关于用户-物品评分矩阵

  • 用户-物品的评分矩阵,根据评分矩阵的稀疏程度会有不同的解决方案,一般有两种情形:
  1. 稠密评分矩阵
    在这里插入图片描述

  2. 稀疏评分矩阵
    在这里插入图片描述

代码及实现

  • 构建数据集
import pandas as pd
import numpy as npusers = ["Thomas", "Cauchy", "Alice", "Bob", "Alex"]
items = ["iPad", "MacBook", "iPhone", "iWatch", "AirPods"]
#用户购买记录数据集
#构建评分数据时,对于缺失的部分我们需要保留为None,如果设置为0那么会被当作评分值为0去对待
datasets = [[5,3,4,4,None],[3,1,2,3,3],[4,3,4,3,5],[3,3,1,5,4],[1,5,5,2,1],
]
  • 计算相似度
#对于评分数据这里我们采用皮尔逊相关系数[-1,1]来计算,-1表示强负相关,+1表示强正相关。 pandas中corr方法可直接用于计算皮尔逊相关系数
df = pd.DataFrame(datasets,columns=items,index=users)print("用户之间的两两相似度:")# 默认是按列进行计算,因此如果计算用户间的相似度,当前需要进行转置
user_similar = df.T.corr()
print(user_similar.round(4))print("物品之间的两两相似度:")
item_similar = df.corr()
print(item_similar.round(4))

在这里插入图片描述
Tips:我们在做预测评分时,往往是通过与其有正相关的用户或物品进行预测,如果不存在正相关的情况,那么将无法做出预测。在稀疏矩阵中尤为常见,因为稀疏评分矩阵中很难得出正相关系数。

如何计算评分预测?

  1. User-Based CF 评分预测:使用用户间的相似度进行预测
    用户本身的评分评分以及近邻用户的加权平均相似度打分来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与Thomas最近邻的Cauchy和Alice进行预测,计算如下:
    在这里插入图片描述
  2. Item-Based CF 评分预测:使用物品间的相似度进行预测
    结合预测物品与相似物品的加权平均相似度打分进行来进行预测
    在这里插入图片描述
    我们要预测Thomas对AirPods的评分,那么可以根据与AirPods最近邻的iPad和iWatch进行预测,计算如下:
    在这里插入图片描述

总结

User-Based CF预测评分和Item-Based CF的评分结果会存在差异,主要原因是他们其实是属于两种不同的推荐算法,各自在不同的领域与不同场景下,都会比另一种的效果更佳。如果是哪种是最佳评分,必须进行合理的效果评估,因此在实现推荐系统时这两种算法往往都是需要去实现的,然后对产生的推荐效果进行评估分析选出更优方案。

这篇关于协同过滤算法之连续评分通过皮尔逊相关系数计算相似度原理及代码实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/739273

相关文章

Python Transformers库(NLP处理库)案例代码讲解

《PythonTransformers库(NLP处理库)案例代码讲解》本文介绍transformers库的全面讲解,包含基础知识、高级用法、案例代码及学习路径,内容经过组织,适合不同阶段的学习者,对... 目录一、基础知识1. Transformers 库简介2. 安装与环境配置3. 快速上手示例二、核心模

python实现svg图片转换为png和gif

《python实现svg图片转换为png和gif》这篇文章主要为大家详细介绍了python如何实现将svg图片格式转换为png和gif,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录python实现svg图片转换为png和gifpython实现图片格式之间的相互转换延展:基于Py

Python利用ElementTree实现快速解析XML文件

《Python利用ElementTree实现快速解析XML文件》ElementTree是Python标准库的一部分,而且是Python标准库中用于解析和操作XML数据的模块,下面小编就来和大家详细讲讲... 目录一、XML文件解析到底有多重要二、ElementTree快速入门1. 加载XML的两种方式2.

Java的栈与队列实现代码解析

《Java的栈与队列实现代码解析》栈是常见的线性数据结构,栈的特点是以先进后出的形式,后进先出,先进后出,分为栈底和栈顶,栈应用于内存的分配,表达式求值,存储临时的数据和方法的调用等,本文给大家介绍J... 目录栈的概念(Stack)栈的实现代码队列(Queue)模拟实现队列(双链表实现)循环队列(循环数组

C++如何通过Qt反射机制实现数据类序列化

《C++如何通过Qt反射机制实现数据类序列化》在C++工程中经常需要使用数据类,并对数据类进行存储、打印、调试等操作,所以本文就来聊聊C++如何通过Qt反射机制实现数据类序列化吧... 目录设计预期设计思路代码实现使用方法在 C++ 工程中经常需要使用数据类,并对数据类进行存储、打印、调试等操作。由于数据类

Python实现图片分割的多种方法总结

《Python实现图片分割的多种方法总结》图片分割是图像处理中的一个重要任务,它的目标是将图像划分为多个区域或者对象,本文为大家整理了一些常用的分割方法,大家可以根据需求自行选择... 目录1. 基于传统图像处理的分割方法(1) 使用固定阈值分割图片(2) 自适应阈值分割(3) 使用图像边缘检测分割(4)

Android实现在线预览office文档的示例详解

《Android实现在线预览office文档的示例详解》在移动端展示在线Office文档(如Word、Excel、PPT)是一项常见需求,这篇文章为大家重点介绍了两种方案的实现方法,希望对大家有一定的... 目录一、项目概述二、相关技术知识三、实现思路3.1 方案一:WebView + Office Onl

C# foreach 循环中获取索引的实现方式

《C#foreach循环中获取索引的实现方式》:本文主要介绍C#foreach循环中获取索引的实现方式,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录一、手动维护索引变量二、LINQ Select + 元组解构三、扩展方法封装索引四、使用 for 循环替代

Spring Security+JWT如何实现前后端分离权限控制

《SpringSecurity+JWT如何实现前后端分离权限控制》本篇将手把手教你用SpringSecurity+JWT搭建一套完整的登录认证与权限控制体系,具有很好的参考价值,希望对大家... 目录Spring Security+JWT实现前后端分离权限控制实战一、为什么要用 JWT?二、JWT 基本结构

Java实现优雅日期处理的方案详解

《Java实现优雅日期处理的方案详解》在我们的日常工作中,需要经常处理各种格式,各种类似的的日期或者时间,下面我们就来看看如何使用java处理这样的日期问题吧,感兴趣的小伙伴可以跟随小编一起学习一下... 目录前言一、日期的坑1.1 日期格式化陷阱1.2 时区转换二、优雅方案的进阶之路2.1 线程安全重构2