优雅地展示20w单细胞热图|非Doheatmap 超大数据集 细胞数太多

本文主要是介绍优雅地展示20w单细胞热图|非Doheatmap 超大数据集 细胞数太多,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

单细胞超大数据集的热图怎么画?昨天刚做完展示20万单细胞的热图要这么画吗? 今天就有人发消息问我为啥他画出来的热图有问题。

问题起源

昨天分享完  20万单细胞的热图要这么画吗?,就有人问为啥他的数据会出错。我们先来看下他的数据

  • 数据输入部分

cluster_gene_stat=FindAllMarkers(d.all,only.pos = TRUE,logfc.threshold = 0.4)head(cluster_gene_stat)table(cluster_gene_stat$cluster)DimPlot(d.all)d.all$orig.ident=Idents(d.all)table(d.all$orig.ident)Idents(d.all)=paste0('cluster',d.all$orig.ident)a=AverageExpression(d.all,return.seurat = TRUE)a$orig.ident=rownames(a@meta.data)head(a@meta.data)head(markers)markers=cluster_gene_statDoHeatmap(a,draw.lines = FALSE, slot = 'scale.data',assay = 'SCT',          features = markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 5) %>% .$gene )
  • 画图所需数据

他画出来的图是这样:

markers$cluster=paste0("cluster",markers$cluster)markers$cluster=factor(markers$cluster,levels = unique(markers$cluster))DoHeatmap(a,draw.lines = FALSE, slot = 'scale.data',assay = 'SCT',          features = markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 5) %>% .$gene )

  • 和我的图20万单细胞的热图要这么画吗? 区别在于没有列名,图注也不完整,且热图色块是乱序的


解决方法

  • 1. 方倒是简单,重新添加列名即可添加即可

Idents(d.all)=paste0('cluster',d.all$orig.ident)a=AverageExpression(d.all,return.seurat = TRUE)a$orig.ident=rownames(a@meta.data)DoHeatmap(a,draw.lines = FALSE, slot = 'scale.data',      assay = 'SCT',group.by = 'orig.ident',          features = markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 5) %>% .$gene )

  • 2. 调整因子顺序,让热图中的色块更好看些

markers$cluster=factor(markers$cluster,levels = paste0('cluster',seq(0,8,1)) )head(markers)head(a@meta.data)DoHeatmap(a,draw.lines = FALSE, slot = 'scale.data',assay = 'SCT',group.by = 'orig.ident',          features = markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 5) %>% .$gene )

但是你会发现 右边地图注少了cluster8。

为什么cluster8会缺失?我觉得这是bug,盲猜可能由于markers内的cluster8对应地基因在a里是na


  • 3. 自己手动添加图注cluster8即可

DoHeatmap(a,features =  markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 5) %>% .$gene,          draw.lines = FALSE,group.by = 'orig.ident') +  ggplot2:: scale_color_discrete(name = "Identity", labels =  paste0('cluster',seq(0,8,1))  )

  • 3. 如果热图中想多加几个基因的话 

DoHeatmap(a,features =  markers %>%group_by(cluster) %>%dplyr::slice_max(avg_log2FC,n = 15) %>% .$gene,          draw.lines = FALSE,group.by = 'orig.ident') +  ggplot2:: scale_color_discrete(name = "Identity", labels =  paste0('cluster',seq(0,8,1))  )

只能这样了,这里所有热图都挺丑的,瘸子里面选巧匠吧


画外音:

这种热图不好看的根本原因在于数据的问题。提示我们需要合并、删除某些cluster,然后再来画热图会更好看。

如果你不会合并、删除某些cluster。可以先看看我之前的直播:

直播四-单细胞个性化注释、细分亚群并把细分亚群放回总群

如果还是不懂,找机会再直播一次~


这篇关于优雅地展示20w单细胞热图|非Doheatmap 超大数据集 细胞数太多的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/569805

相关文章

python处理带有时区的日期和时间数据

《python处理带有时区的日期和时间数据》这篇文章主要为大家详细介绍了如何在Python中使用pytz库处理时区信息,包括获取当前UTC时间,转换为特定时区等,有需要的小伙伴可以参考一下... 目录时区基本信息python datetime使用timezonepandas处理时区数据知识延展时区基本信息

Qt实现网络数据解析的方法总结

《Qt实现网络数据解析的方法总结》在Qt中解析网络数据通常涉及接收原始字节流,并将其转换为有意义的应用层数据,这篇文章为大家介绍了详细步骤和示例,感兴趣的小伙伴可以了解下... 目录1. 网络数据接收2. 缓冲区管理(处理粘包/拆包)3. 常见数据格式解析3.1 jsON解析3.2 XML解析3.3 自定义

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处

Spring Boot中JSON数值溢出问题从报错到优雅解决办法

《SpringBoot中JSON数值溢出问题从报错到优雅解决办法》:本文主要介绍SpringBoot中JSON数值溢出问题从报错到优雅的解决办法,通过修改字段类型为Long、添加全局异常处理和... 目录一、问题背景:为什么我的接口突然报错了?二、为什么会发生这个错误?1. Java 数据类型的“容量”限制

如何使用 Python 读取 Excel 数据

《如何使用Python读取Excel数据》:本文主要介绍使用Python读取Excel数据的详细教程,通过pandas和openpyxl,你可以轻松读取Excel文件,并进行各种数据处理操... 目录使用 python 读取 Excel 数据的详细教程1. 安装必要的依赖2. 读取 Excel 文件3. 读

Spring 请求之传递 JSON 数据的操作方法

《Spring请求之传递JSON数据的操作方法》JSON就是一种数据格式,有自己的格式和语法,使用文本表示一个对象或数组的信息,因此JSON本质是字符串,主要负责在不同的语言中数据传递和交换,这... 目录jsON 概念JSON 语法JSON 的语法JSON 的两种结构JSON 字符串和 Java 对象互转

C++如何通过Qt反射机制实现数据类序列化

《C++如何通过Qt反射机制实现数据类序列化》在C++工程中经常需要使用数据类,并对数据类进行存储、打印、调试等操作,所以本文就来聊聊C++如何通过Qt反射机制实现数据类序列化吧... 目录设计预期设计思路代码实现使用方法在 C++ 工程中经常需要使用数据类,并对数据类进行存储、打印、调试等操作。由于数据类

Java实现优雅日期处理的方案详解

《Java实现优雅日期处理的方案详解》在我们的日常工作中,需要经常处理各种格式,各种类似的的日期或者时间,下面我们就来看看如何使用java处理这样的日期问题吧,感兴趣的小伙伴可以跟随小编一起学习一下... 目录前言一、日期的坑1.1 日期格式化陷阱1.2 时区转换二、优雅方案的进阶之路2.1 线程安全重构2

SpringBoot使用GZIP压缩反回数据问题

《SpringBoot使用GZIP压缩反回数据问题》:本文主要介绍SpringBoot使用GZIP压缩反回数据问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录SpringBoot使用GZIP压缩反回数据1、初识gzip2、gzip是什么,可以干什么?3、Spr