R语言画图 | 如何看已知基因list的细胞类型特异性表达?

2023-10-19 23:50

本文主要是介绍R语言画图 | 如何看已知基因list的细胞类型特异性表达?,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

自己学东西,觉得举步维艰。网上的资源太多了,反而让人很容易陷入一种焦躁和慌乱中。不知道从哪里理出头绪来。是碎片化的,不成体系的。自己需要对信息进行过滤,整合成自己的方法。

目标:加载作者的处理过的有细胞类型标签的数据,对数据进行差异表达分析,找到特定的组织中差异表达的基因。

注明以下使用到的数据来源:http://development.psychencode.org/files/processed_data/scRNA-seq/Sestan.fetalHuman.Psychencode.Rdata

该数据为这篇文章中作者用到的,胎儿的大脑数据。
在Rdata中存放有三个数据矩阵。

  • count2:原始count值
  • cpm2:归一化处理后的数据矩阵
  • meta2:关于细胞与样本的详细注释信息,里面有作者已经分类后的每一个细胞对应的数据类型
    整体上这个数据有60155行,762列。

我们需要在上述已有数据的基础上,实现我们的目标。

load("F:/Rworkplace/celltype_specifc/Sestan.fetalHuman.Psychencode.Rdata")
library(dplyr)
library(Seurat)
library(patchwork)
dim(count2)
[1] 60155 762
data<-CreateSeuratObject(counts=count2,project = "fetal",meta.data = meta2,min.cells=0,min.features=0)
#data@meta.data<-meta2
data<-NormalizeData(data,normalization.method="RC",scale.factor = 1000000) #这里就是计算了cpm的值
#这里实际上进行了cpm的转换#筛选标准:该基因至少在300个细胞中表达,每一个细胞中至少有300个基因表达,对这个matrix进行行列层面的筛选。

将原先meta.data中的celltype的变量赋值到Idents中。得到细胞的类型标签。

Idents(object=data)<-data@meta.data$ctype #这一步是成功的第一步,已有的细胞注释的结果
levels(x=data)

到这一步的话,似乎就是利用原始的数据来做的。

我之所以举步维艰,是因为:
(1)我不知道每一步的含义,是否可以视特殊情况而去除;
(2)我不知道更多的函数应该怎样使用;

接着进行差异表达基因分析。

markers<-FindAllMarkers(data,only.pos = TRUE ,logfc.threshold = 2,min.pct = 0.25,test.use="roc")
write.csv(markers,"DEG_all2.csv")
VlnPlot(object=data,feature=c("ENSG00000189238-LINC00943"),log = T)

到这里虽然还不知道如何使用cpm后的数据进行差异表达分析。
但是比较欣慰的是,可以确保找到的差异表达基因与作者的基因是一样的了。即,得到的DEG_all.csv这个list是有意义的。
使用roc进行差异表达分析,似乎效果更好。【首选:有时间要总结一下差异表达分析常用的方法】

得到这个list之后,我们与我们自己的list进行比照,看看我们的list中,有多少是在这个细胞类型特异性的差异表达基因中的。

DEG<-read.csv("DEG_all2.csv")
library(stringr)
gene_split<-as.data.frame(str_split_fixed(DEG$gene,"-",n=2))
head(gene_split)
head(DEG)
DEG_m<-cbind(DEG,gene_split)
interest<-read.table("result_coding_gene_id_2.txt")
DEG_interest<-merge(DEG_m,interest) #112/4205
write.csv(DEG_interest$gene,"DEG_interest_celltype.csv")

得到了一些基因在特定的细胞类型中表达。

table(DEG_interest_2$cluster) 112/4205

Astro Endo ExN1 ExN2 ExN3 InN1 IPC1
6 26 2 7 9 2 4
IPC2 Microglia NasN1 NasN5 NasN6 NEPRGC1 NEPRGC2
1 20 2 1 1 1 2
NEPRGC3 Oligo OPC1 Pericyte
2 4 2 20

根据这些基因,绘制heatmap。

DEG_interest_2<-DEG_interest[order(DEG_interest$cluster,decreasing =FALSE ),]
DoHeatmap(data,features = DEG_interest_2$gene,draw.lines = TRUE,label = T,size = 2)+NoLegend()

可能这个工具还没有用熟悉,所以画出来的图是真的很丑(后面再进行润色和调整)。
在这里插入图片描述保存这次的处理结果。

DEG_interest_2<-DEG_interest[order(DEG_interest$cluster,decreasing =FALSE ),]
a<-subset(DEG_interest_2,select=c("gene","cluster"))
tissue<-rep("fetal",dim(DEG_interest_2)[1])
d<-cbind(a,tissue)
colnames(d)<-c("gene","cell_type","label")
write.csv(d,"DEG_interest_celltype2.csv")

最后测试一下分类标签是否正确。

VlnPlot(object=data,feature=c("ENSG00000122547-EEPD1"),log = T)

在这里插入图片描述完成目标。

现在存在的疑惑就是,是否需要吧ExN1、ExN2、ExN3这些都属于ExN细胞的细胞类型合并起来进行差异表达分析。
现在先这样,可能后期,还有再加上这些大的class(如,ExN/NasN/IPC)所共有的相对于其他class而言的差异基因。


接下来想处理adult的数据,没想到遇到了不能避免的数据太大的问题。

load("F://Rworkplace//celltype_specifc//phyEncode_adult//Sestan.adultHumanNuclei.Psychencode.Rdata")
library(dplyr)
library(Seurat)
library(patchwork)

报错:

Error: cannot allocate vector of size 3.0 Gb

只能回到服务器上操作。但是服务器上,我连seurat的包都安装不了,哭泣!看来,那边是必然要解决的问题,有必要可以求助师兄!

这篇关于R语言画图 | 如何看已知基因list的细胞类型特异性表达?的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/243188

相关文章

Go语言中make和new的区别及说明

《Go语言中make和new的区别及说明》:本文主要介绍Go语言中make和new的区别及说明,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1 概述2 new 函数2.1 功能2.2 语法2.3 初始化案例3 make 函数3.1 功能3.2 语法3.3 初始化

C# 比较两个list 之间元素差异的常用方法

《C#比较两个list之间元素差异的常用方法》:本文主要介绍C#比较两个list之间元素差异,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录1. 使用Except方法2. 使用Except的逆操作3. 使用LINQ的Join,GroupJoin

Go语言中nil判断的注意事项(最新推荐)

《Go语言中nil判断的注意事项(最新推荐)》本文给大家介绍Go语言中nil判断的注意事项,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录1.接口变量的特殊行为2.nil的合法类型3.nil值的实用行为4.自定义类型与nil5.反射判断nil6.函数返回的

Go语言数据库编程GORM 的基本使用详解

《Go语言数据库编程GORM的基本使用详解》GORM是Go语言流行的ORM框架,封装database/sql,支持自动迁移、关联、事务等,提供CRUD、条件查询、钩子函数、日志等功能,简化数据库操作... 目录一、安装与初始化1. 安装 GORM 及数据库驱动2. 建立数据库连接二、定义模型结构体三、自动迁

Go语言代码格式化的技巧分享

《Go语言代码格式化的技巧分享》在Go语言的开发过程中,代码格式化是一个看似细微却至关重要的环节,良好的代码格式化不仅能提升代码的可读性,还能促进团队协作,减少因代码风格差异引发的问题,Go在代码格式... 目录一、Go 语言代码格式化的重要性二、Go 语言代码格式化工具:gofmt 与 go fmt(一)

python3如何找到字典的下标index、获取list中指定元素的位置索引

《python3如何找到字典的下标index、获取list中指定元素的位置索引》:本文主要介绍python3如何找到字典的下标index、获取list中指定元素的位置索引问题,具有很好的参考价值,... 目录enumerate()找到字典的下标 index获取list中指定元素的位置索引总结enumerat

Go语言中泄漏缓冲区的问题解决

《Go语言中泄漏缓冲区的问题解决》缓冲区是一种常见的数据结构,常被用于在不同的并发单元之间传递数据,然而,若缓冲区使用不当,就可能引发泄漏缓冲区问题,本文就来介绍一下问题的解决,感兴趣的可以了解一下... 目录引言泄漏缓冲区的基本概念代码示例:泄漏缓冲区的产生项目场景:Web 服务器中的请求缓冲场景描述代码

Go语言如何判断两张图片的相似度

《Go语言如何判断两张图片的相似度》这篇文章主要为大家详细介绍了Go语言如何中实现判断两张图片的相似度的两种方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 在介绍技术细节前,我们先来看看图片对比在哪些场景下可以用得到:图片去重:自动删除重复图片,为存储空间"瘦身"。想象你是一个

Go语言中Recover机制的使用

《Go语言中Recover机制的使用》Go语言的recover机制通过defer函数捕获panic,实现异常恢复与程序稳定性,具有一定的参考价值,感兴趣的可以了解一下... 目录引言Recover 的基本概念基本代码示例简单的 Recover 示例嵌套函数中的 Recover项目场景中的应用Web 服务器中

C#之List集合去重复对象的实现方法

《C#之List集合去重复对象的实现方法》:本文主要介绍C#之List集合去重复对象的实现方法,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录C# List集合去重复对象方法1、测试数据2、测试数据3、知识点补充总结C# List集合去重复对象方法1、测试数据