看书标记【数据科学:R语言实战 6】

2024-03-28 23:04

本文主要是介绍看书标记【数据科学:R语言实战 6】,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

看书标记——R语言

  • Chapter 6 数据分析——聚类
      • 6.1 功能包
      • 6.2 K-means聚类
        • 6.2.1 示例
        • 6.2.2 Medoids集群
        • 6.2.3 cascadeKM函数
        • 6.2.4 基于贝叶斯定理
        • 6.2.5 仿射传播聚类
        • 6.2.6 用于估测集群数量的间隙统计量
        • 6.2.7 分级聚类

【数据科学:R语言实战】

Chapter 6 数据分析——聚类

6.1 功能包

  • NbClust:集群指数的数量
  • fpc:包含进行聚类的灵活程序
  • vegan:社区生态功能包
  • apcluster:用于仿射传播聚类操作
  • pvclust:用于分级聚类操作

6.2 K-means聚类

kmeans()

  • 参数
    x 数据集
    centers 包含了所要查找的中心/集群数量
    iter.max 存储了所允许迭代的最大量
    nstart 包含了所要查找的随机整群数
    algorithm 包含了用于确定集群的算法(“Hartigan-Wong\Lloyd”)
    trace 生成跟踪信息以确定中心
6.2.1 示例

数据源葡萄酒质量数据(这个数据从UCI机器学习数据库得到)

data <- read.csv("https://archive.ics.uci.edu/ml/machine-learningdatabases/wine-quality/winequality-white.csv", sep=";")##不是标准CSV文件,用的;分栏
# summary(data)
plot(data) ##关系密切
kmeans(data,5)
# kmeans(data,10)
# kmeans(data,15)
# kmeans(data,20)

最佳集群数量
NbClust()通过使用一些列度量中心和距离的指数对每个集群复查,并对每个集群所设定的优选数字频数进行计数。
data 数据集
diss 相异矩阵
distance 待用的距离度量
min.nc 最小集群数
max.nc 最大集群数
**method ** “ward/single/compete/average/mcquitty/median/centroid/kmeans”
index 待计算的指数
alphaBeale 包含了比尔指数的一个重要数值

install.packages("NbClust")
library(NbClust)
set.seed(2365)  ##保证过程可以复写
nc <- NbClust(data, min.nc=10, max.nc=15, method="kmeans") #propose提议,所以选择最佳聚类中心数11
6.2.2 Medoids集群

fpc中的pamk()将最小相异度作为行列式使用(对应kmeans中的距离)

  • 参数
    data 数据集
    krange 集群数量,默认2~10
    criterion “asw/multiasw/ch” average silhouette 方法
    usepam 逻辑标记,默认TRUE,也可以写为pam,对于大数据集用clara=TRUE
    scaling 逻辑标记,默认FALSE,均方根会对变量进行划分
    alpha dudahart方法的调谐常数,默认0.001
    diss 使用相异点矩阵的逻辑标记
    critout 默认为FALSE,集群印刷标准的逻辑标记
install.packages("fpc")
library(fpc)
best <- pamk(data);best
library(cluster)
plot(pam(data, best$nc))
6.2.3 cascadeKM函数

vegan包里的cascadeKM()是kmeans实施的包装器,用于确定最佳k值

install.packages("vegan")
library(vegan)
fit <- cascadeKM(scale(data, center=TRUE, scale=TRUE), 10, 15) ##inf.gr下限,sup.gr上限,iter迭代次数默认100,criterion ="calinski/ssi"选取集群标准
plot(fit, sortg=TRUE, grmts.plot=TRUE)  ##选聚类数对应数值最大的
6.2.4 基于贝叶斯定理

mclust包中的Mclust()是基于数据显示的贝叶斯定理信息 选取最佳集群大小
数据源葡萄酒质量数据(这个数据从UCI机器学习数据库得到)

library(mclust)
d <- Mclust(as.matrix(data), G=10:15)
plot(d)
##图一,不同方式对应的BIC信息与集群数量,选取BIC最小的项
##图二,相关性表
##图三,每个属性对比的对数密度等值线图
summary(d) #n观测数量和迭代次数,最佳集群数量为11,各个集群对应的数据点
6.2.5 仿射传播聚类

apcluster()实施仿射传播聚类,通过比较指定集群相关信息的不同数值实施仿射传播聚类。

install.packages("apcluster")
library(apcluster)
neg <- negDistMat(data, r=2)
ap <- apcluster(neg) ;#ap
summary(ap)
length(ap@clusters)  ##最佳集群数81,存在高仿射性
6.2.6 用于估测集群数量的间隙统计量

clusGap()为一系列集群值计算聚类度量适合度或间隙统计量

  • 参数
    x 数据集
    FUNcluster 聚类函数
    K.max 最大集群数
    B 所用Monte Carlo样品数
    verbose 用以辨别是否生成进度输出
data <- read.csv("https://archive.ics.uci.edu/ml/machine-learningdatabases/wine-quality/winequality-white.csv", sep=";")##不是标准CSV文件,用的;分栏
library(cluster)
clusGap(data, kmeans, 15, B=100, verbose=interactive()) ###选gap最大的集群数
6.2.7 分级聚类

pvclust包中的pvclust()实施分类聚类

  • 参数
    data 数据框矩阵
    method.hclust 凝聚算法"默认averge/ward/single/complete/mcquitty/median/centroid"
    method.dist 待用距离度量"默认correlation/uncentered/abscor"
    use.cor 待用的用以计算空缺值相关性的方法"all.obs/complete.obs/pairwise.complete.obs"
install.packages("pvclust")
library(pvclust)
data <- read.csv("https://archive.ics.uci.edu/ml/machine-learningdatabases/wine-quality/winequality-white.csv", sep=";")##不是标准CSV文件,用的;分栏
pv <- pvclust(data);pv
plot(pv)  ##聚类系统树图

转载 机器学习确定最佳聚类数目的10种方法

这篇关于看书标记【数据科学:R语言实战 6】的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/856936

相关文章

Python获取中国节假日数据记录入JSON文件

《Python获取中国节假日数据记录入JSON文件》项目系统内置的日历应用为了提升用户体验,特别设置了在调休日期显示“休”的UI图标功能,那么问题是这些调休数据从哪里来呢?我尝试一种更为智能的方法:P... 目录节假日数据获取存入jsON文件节假日数据读取封装完整代码项目系统内置的日历应用为了提升用户体验,

Spring Boot + MyBatis Plus 高效开发实战从入门到进阶优化(推荐)

《SpringBoot+MyBatisPlus高效开发实战从入门到进阶优化(推荐)》本文将详细介绍SpringBoot+MyBatisPlus的完整开发流程,并深入剖析分页查询、批量操作、动... 目录Spring Boot + MyBATis Plus 高效开发实战:从入门到进阶优化1. MyBatis

MyBatis 动态 SQL 优化之标签的实战与技巧(常见用法)

《MyBatis动态SQL优化之标签的实战与技巧(常见用法)》本文通过详细的示例和实际应用场景,介绍了如何有效利用这些标签来优化MyBatis配置,提升开发效率,确保SQL的高效执行和安全性,感... 目录动态SQL详解一、动态SQL的核心概念1.1 什么是动态SQL?1.2 动态SQL的优点1.3 动态S

Pandas使用SQLite3实战

《Pandas使用SQLite3实战》本文主要介绍了Pandas使用SQLite3实战,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学... 目录1 环境准备2 从 SQLite3VlfrWQzgt 读取数据到 DataFrame基础用法:读

Java利用JSONPath操作JSON数据的技术指南

《Java利用JSONPath操作JSON数据的技术指南》JSONPath是一种强大的工具,用于查询和操作JSON数据,类似于SQL的语法,它为处理复杂的JSON数据结构提供了简单且高效... 目录1、简述2、什么是 jsONPath?3、Java 示例3.1 基本查询3.2 过滤查询3.3 递归搜索3.4

MySQL大表数据的分区与分库分表的实现

《MySQL大表数据的分区与分库分表的实现》数据库的分区和分库分表是两种常用的技术方案,本文主要介绍了MySQL大表数据的分区与分库分表的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有... 目录1. mysql大表数据的分区1.1 什么是分区?1.2 分区的类型1.3 分区的优点1.4 分

Mysql删除几亿条数据表中的部分数据的方法实现

《Mysql删除几亿条数据表中的部分数据的方法实现》在MySQL中删除一个大表中的数据时,需要特别注意操作的性能和对系统的影响,本文主要介绍了Mysql删除几亿条数据表中的部分数据的方法实现,具有一定... 目录1、需求2、方案1. 使用 DELETE 语句分批删除2. 使用 INPLACE ALTER T

Python Dash框架在数据可视化仪表板中的应用与实践记录

《PythonDash框架在数据可视化仪表板中的应用与实践记录》Python的PlotlyDash库提供了一种简便且强大的方式来构建和展示互动式数据仪表板,本篇文章将深入探讨如何使用Dash设计一... 目录python Dash框架在数据可视化仪表板中的应用与实践1. 什么是Plotly Dash?1.1

Redis 中的热点键和数据倾斜示例详解

《Redis中的热点键和数据倾斜示例详解》热点键是指在Redis中被频繁访问的特定键,这些键由于其高访问频率,可能导致Redis服务器的性能问题,尤其是在高并发场景下,本文给大家介绍Redis中的热... 目录Redis 中的热点键和数据倾斜热点键(Hot Key)定义特点应对策略示例数据倾斜(Data S

Python实现将MySQL中所有表的数据都导出为CSV文件并压缩

《Python实现将MySQL中所有表的数据都导出为CSV文件并压缩》这篇文章主要为大家详细介绍了如何使用Python将MySQL数据库中所有表的数据都导出为CSV文件到一个目录,并压缩为zip文件到... python将mysql数据库中所有表的数据都导出为CSV文件到一个目录,并压缩为zip文件到另一个