R数据分析:如何用层次聚类分析做“症状群”,实例操练

2023-10-13 08:20

本文主要是介绍R数据分析:如何用层次聚类分析做“症状群”,实例操练,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

好多同学硕士论文开题咨询我想做症状群,有用因子分析的,也有用潜类别分析的,这些方法之前都给大家写过,今天再给大家写一个用无监督的机器学习方法-------层次聚类做症状群的方法。同学们如果对这个方法有兴趣的话,开题什么的都可以往这方面考虑,希望看了本文之后能够对层次聚类有一定了解,能思考下自己能不能往这个方向上展开。

做出来的结果呈现就是下图:这个是一篇已经发表的文章中截图出来的,作者是将一个疾病的症状聚类了3类,探讨了每一类的特征,并提出了治疗照护的建议。

文章感兴趣的同学自己去瞅瞅哈:Sethares, Kristen & Chin, Elizabeth. (2021). Age and gender differences in physical heart failure symptom clusters. Heart & Lung. 50. 832-837.
10.1016/j.hrtlng.2021.07.001.

今天就带大家看看像这种层次聚类的症状群如何做。

层次聚类的原理

Hierarchical clustering,层次聚类出来的结果就像一个树一样,一层一层地生长,这个树也是完全的数据驱动的,对于陌生领域的探索性研究,像症状群之类的就特别合适。

对于这个一个树,英文叫dendrogram,它怎么形成的呢,很自然地,我们可以让其通过从顶部往下散开这样的方式形成(方式1,英文叫Divisive),也可以让其从根部往上聚合这样的方式形成(方式2,英文叫Agglomerative)。

Divisive : A divisive method begins with all patterns in a single cluster and performs splitting until a stopping criterion is met.

Agglomerative : An agglomerative approach begins with each observation in a distinct (singleton) cluster, and successively merges clusters together until a stopping criterion is satisfied.

这儿我只给大家写方式2,因为这个比较常用,上面截图的文章也是用的方式2的聚类方法实现的。

方式2的基本思路就是:

  1. 先计算每一个类之间的距离
  2. 将最近距离的类合并
  3. 重复1,2直到所有类合并为1个类

上面的步骤走完,一个树就长出来了,直观的图示就是如下:

上图就是假设我们只有两个变量,9个个案(类),从左上角到右下角走完流程9个个案就成了一个类了。

步骤中有提到距离,这里面就涉及到一个距离的计算问题,计算的方法有很多种,本文也不展开,感兴趣的同学可以单独咨询我,常见的距离算法如下:

    • Centroid linkage
  •  Single linkage
  •  Complete linkage
  •  Average linkage
  •  Ward’s method

像截图的文章使用的方法就是Ward’s method。

层次聚类的做法

做从下到上层次聚类用到的函数是hclust(),hclust需要接受的参数是一个距离矩阵,大家直接在R中输入如下代码就可以体验出图的快乐了:

hc = hclust(dist(mtcars))
plot(hc)

在上面的代码中dist函数就是用来计算个案距离的函数的,在这一步的时候一定要将所有数值型变量标准化,不然聚类肯定是不对的,具体地大家可以在dist函数的参数中设定距离的计算方法,比如截图论文中就使用的Ward’s method,我们就可以设定为"ward.D"或者"ward.D2"。

但是我们发现此时聚类的对象依然是个案,其实我们想聚类是症状,也就是我们数据库中的变量,还是用实际例子给大家说明吧。

比如我手上现在有如下形式的数据库,也就是大家会收集到的每个症状:

我想看看病人中这些个症状有哪些”症状群“,首先我们需要将数据框转置,然后再进行聚类,我就可以写出代码如下:

data2 <- t(data2)
mycluster = hclust(dist(data2))
plot(mycluster )

运行代码后就可以出图啦:

其实到这儿大家就可以直观地看出来,应该是有2个症状群的,症状群1包括症状3和4,症状群2包括其余所有的症状,我们依然是将我们的图像论文中那样标注出来:

就是说症状3和4为一个群,而其余的症状为一个群。

你还可以通过给不同症状群打上不同颜色的方式,进一步突出不同症状群,代码如下:

hc_dend_obj <- as.dendrogram(mycluster) 
hc_col_dend <- color_branches(hc_dend_obj, h = 6)
plot(hc_col_dend,hang=-1)

还有一个很重要的问题,就是生成个案的症状群标签,只有有了症状群标签,我们才能像论文中那样去比较不同症状群个案的一般人口学特征,症状群标签可以通过如下代码得到:

hc = hclust(dist(scale(data2)))
cut_avg <- cutree(hc, k = 2)
data_cl <- mutate(data1, cluster = cut_avg)

运行上面的代码后我们再查看原来是数据库,就可以看到新生成的最后一列就是每一个个案是症状群类别。然后我们就可以比较不同症状群的个案在各种变量上的差异了,像这样一篇论文也就完成了。

最后要提醒大家的是,论文作者是用SPSS软件做的,大家也可以用SPSS尝试下哦,就在哪个分析-分类-系统聚类选项里面,我试了试也是完全可以做出来的。

小结

今天给大家写了如何用层次聚类进行症状群的探讨,感谢大家耐心看完,自己的文章都写的很细,代码都在原文中,希望大家都可以自己做一做,请转发本文到朋友圈后私信回复“数据链接”获取所有数据和本人收集的学习资料。如果对您有用请先收藏,再点赞分享。

也欢迎大家的意见和建议,大家想了解什么统计方法都可以在文章下留言,说不定我看见了就会给你写教程哦,另欢迎私信。

这篇关于R数据分析:如何用层次聚类分析做“症状群”,实例操练的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/201928

相关文章

C# WinForms存储过程操作数据库的实例讲解

《C#WinForms存储过程操作数据库的实例讲解》:本文主要介绍C#WinForms存储过程操作数据库的实例,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、存储过程基础二、C# 调用流程1. 数据库连接配置2. 执行存储过程(增删改)3. 查询数据三、事务处

springboot security验证码的登录实例

《springbootsecurity验证码的登录实例》:本文主要介绍springbootsecurity验证码的登录实例,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,... 目录前言代码示例引入依赖定义验证码生成器定义获取验证码及认证接口测试获取验证码登录总结前言在spring

tomcat多实例部署的项目实践

《tomcat多实例部署的项目实践》Tomcat多实例是指在一台设备上运行多个Tomcat服务,这些Tomcat相互独立,本文主要介绍了tomcat多实例部署的项目实践,具有一定的参考价值,感兴趣的可... 目录1.创建项目目录,测试文China编程件2js.创建实例的安装目录3.准备实例的配置文件4.编辑实例的

python+opencv处理颜色之将目标颜色转换实例代码

《python+opencv处理颜色之将目标颜色转换实例代码》OpenCV是一个的跨平台计算机视觉库,可以运行在Linux、Windows和MacOS操作系统上,:本文主要介绍python+ope... 目录下面是代码+ 效果 + 解释转HSV: 关于颜色总是要转HSV的掩膜再标注总结 目标:将红色的部分滤

Spring 中使用反射创建 Bean 实例的几种方式

《Spring中使用反射创建Bean实例的几种方式》文章介绍了在Spring框架中如何使用反射来创建Bean实例,包括使用Class.newInstance()、Constructor.newI... 目录1. 使用 Class.newInstance() (仅限无参构造函数):2. 使用 Construc

MyBatis-Plus中Service接口的lambdaUpdate用法及实例分析

《MyBatis-Plus中Service接口的lambdaUpdate用法及实例分析》本文将详细讲解MyBatis-Plus中的lambdaUpdate用法,并提供丰富的案例来帮助读者更好地理解和应... 目录深入探索MyBATis-Plus中Service接口的lambdaUpdate用法及示例案例背景

MyBatis-Plus中静态工具Db的多种用法及实例分析

《MyBatis-Plus中静态工具Db的多种用法及实例分析》本文将详细讲解MyBatis-Plus中静态工具Db的各种用法,并结合具体案例进行演示和说明,具有很好的参考价值,希望对大家有所帮助,如有... 目录MyBATis-Plus中静态工具Db的多种用法及实例案例背景使用静态工具Db进行数据库操作插入

Spring中@Lazy注解的使用技巧与实例解析

《Spring中@Lazy注解的使用技巧与实例解析》@Lazy注解在Spring框架中用于延迟Bean的初始化,优化应用启动性能,它不仅适用于@Bean和@Component,还可以用于注入点,通过将... 目录一、@Lazy注解的作用(一)延迟Bean的初始化(二)与@Autowired结合使用二、实例解

前端原生js实现拖拽排课效果实例

《前端原生js实现拖拽排课效果实例》:本文主要介绍如何实现一个简单的课程表拖拽功能,通过HTML、CSS和JavaScript的配合,我们实现了课程项的拖拽、放置和显示功能,文中通过实例代码介绍的... 目录1. 效果展示2. 效果分析2.1 关键点2.2 实现方法3. 代码实现3.1 html部分3.2

mysqld_multi在Linux服务器上运行多个MySQL实例

《mysqld_multi在Linux服务器上运行多个MySQL实例》在Linux系统上使用mysqld_multi来启动和管理多个MySQL实例是一种常见的做法,这种方式允许你在同一台机器上运行多个... 目录1. 安装mysql2. 配置文件示例配置文件3. 创建数据目录4. 启动和管理实例启动所有实例