HPA数据库及HPAanalyze包使用

2024-03-16 02:20

本文主要是介绍HPA数据库及HPAanalyze包使用,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

关于HPA数据库的介绍:Human Protein Atlas 数据库 – 王进的个人网站 (jingege.wang)

The Human Protein Atlas


文献

HPAanalyze: an R package that facilitates the retrieval and analysis of the Human Protein Atlas data | BMC Bioinformatics | Full Text (biomedcentral.com)

HPAanalyze 是一个 R 包,用于检索和执行来自 HPA 的数据的探索性分析。HPAanalyze提供了从HPA导入数据表和xml文件、导出和可视化数据以及下载所有感兴趣的染色图像的功能。

不同的 HPA 数据格式

HPA 项目通过两种主要机制提供数据:以可下载的压缩制表符分隔值 (TSV) 文件形式提供完整数据集,以及可扩展标记语言 (XML)、资源描述框架 (RDF) 和 TSV 格式的单个条目。完整的可下载数据集包括正常组织、病理学(癌症)、亚细胞位置、RNA 基因和 RNA 亚型数据。对于单个条目,XML 格式是最全面的:它提供有关靶蛋白、抗体和每个组织的摘要的信息。此外,还提供了每个样本的详细数据,包括临床信息、免疫组织化学 (IHC) 评分和图像下载链接。

HPAanalyze 概述

HPAanalyze 旨在完成三个主要任务:(1) 导入、子集和导出可下载数据集;(2)用于探索性分析的可下载数据集的可视化;(3)促进单个XML文件的工作(图1)。1). 该软件包旨在为编程经验不足的研究人员提供服务,同时也允许高级用户根据需要使用导入的数据。

(1) 用于可下载数据集的 hpaDownload;(2) hpaVis,用于快速和可定制的可视化;(3) hpaXml,用于从单个 XML 文件中提取信息。显示的图像是生成的示例数据或可从 HPA 下载的图像。

原文还提供了许多示例进行分析


HPAanalyze包下载病理切片数据

由于HPA在线网站上的病理切片数据下载不方便,遂采用R包进行相关数据的下载。其他数据下载在教程中有详细介绍,这里测试病理数据的下载。

Bioconductor - HPAanalyze

HPAanalyze: HPA数据库使用 (gitee.com)

rm(list = ls())
#包安装##
if (!require("BiocManager", quietly = TRUE))install.packages("BiocManager")
BiocManager::install("HPAanalyze")
BiocManager::install("BiocStyle")##还需要辅助安装#加载包 Update all/some/none? [a/s/n]: n
library(BiocStyle)
library(HPAanalyze)
library(dplyr)

例子从NCBI查找需要的基因:CCNB1

Search: ENSG00000134057 - NLM (nih.gov)

解决网络问题方案:什么鬼,你才60秒? - 知乎 (zhihu.com)

查看信息技巧:R语言将list转变为dataframe(常用)_r list 转换成 dataframe-CSDN博客


病理数据下载

## -----------------------------------------------------------------------------
?hpaXmlGet
CCNB1xml <- hpaXmlGet("ENSG00000134057")
##网络问题#
#In download.file(url = version_to_xml_url(targetEnsemblId, version),  :
#URL 'https://www.proteinatlas.org/ENSG00000134057.xml': Timeout of 60 seconds was reached
#多次尝试测试#CCNB1_ab <- hpaXmlAntibody(CCNB1xml)#提取用于特定蛋白质的抗体的信息
CCNB1_ab##查看蛋白结果信息CCNB1_expr <- hpaXmlTissueExpr(CCNB1xml)
#从hpaXmlGet()生成的导入xml文档中提取每个样本的组织表达信息和url以下载图像
str(CCNB1_expr[[1]])
data <- CCNB1_expr[[1]]
##查看该抗的样本具体信息(很重要,也可以直接通过具体信息下载需要的图片)dir.create("img")
for (i in 1:nrow(CCNB1_expr[[1]])) {download.file(CCNB1_expr[[1]]$imageUrl[i],destfile = paste0("img/", CCNB1_ab$id[1], "_",CCNB1_expr[[1]]$patientId[i], "_",CCNB1_expr[[1]]$tissueDescription2[i],## the extra i below ensures unique file namei, ".jpg"),mode = "wb")}

hpaXml 函数系列支持从 HPA 为每种蛋白质提供的单个 XML 文件中导入和提取数据。使用 XML 文件的典型工作流包括以下步骤:

  1. 使用 hpaXmlGet 下载并导入 XML 文件。

  2. 使用其他 hpaXml 函数提取所需的信息。

  3. 下载 hpaXmlTissurExpr 和 hpaXmlTissueExprSum 函数当前支持的组织学染色图像。该函数返回一个列表,其中包含一个摘要字符串,它是对蛋白质的一个非常简短的描述,还有一个由两列组成的表:组织(可用组织的名称)和imageUrl(下载透视图像的链接)

hpaXmlGet 函数采用一个 HGNC 符号或 Ensembl ID(以 ENSG 开头),并将透视 XML 文件导入到 R 中。此函数在后台调用 xml2::read_xml 函数,因此如果需要,可以使用 xml2 包中的函数进一步处理生成的对象。可以使用 hpaXmlProtClass 从导入的 XML 中提取查询蛋白质的蛋白质类。函数 hpaXmlTissueExprSum 提取目标蛋白在正常组织中的表达摘要。该函数的输出是 (1) 包含一句话摘要的字符串,以及 (2) 蛋白质阳性染色的所有组织的数据框以及这些组织的图像。

XML 文件是唯一可编程访问的 HPA 数据格式,其中包含有关项目中使用的每种抗体和每个组织样本的信息。hpaXmlAntibody 提取抗体信息,并返回一个数据框,每个抗体有一行。hpaXmlTissueExpr 提取上述每种抗体的所有样本信息,并返回数据帧列表。如果抗体尚未用于 IHC 染色,则返回的数据框将为空。每个数据框包含临床数据(患者 ID、年龄、性别)、组织信息(snomedCode、tissueDescription)、染色结果(染色、强度、位置)和每个样本的一个 imageUrl

方法一:通过代码批量下载病理数据

方法二:可以直接通过图片信息链接下载保存图片

http://images.proteinatlas.org/115/2043_B_2_8.jpg


qupath进一步半定量分析

下载一张ki67 染色IHC进行半定量分析测试:明天在写

数字病理图像分析的开源软件qupath学习 ①-CSDN博客

Projects — QuPath 0.5.1 documentation


参考文献:

1:HPAanalyze: an R package that facilitates the retrieval and analysis of the Human Protein Atlas data

2:Bioconductor - HPAanalyze

这篇关于HPA数据库及HPAanalyze包使用的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/813996

相关文章

使用DeepSeek API 结合VSCode提升开发效率

《使用DeepSeekAPI结合VSCode提升开发效率》:本文主要介绍DeepSeekAPI与VisualStudioCode(VSCode)结合使用,以提升软件开发效率,具有一定的参考价值... 目录引言准备工作安装必要的 VSCode 扩展配置 DeepSeek API1. 创建 API 请求文件2.

使用TomCat,service输出台出现乱码的解决

《使用TomCat,service输出台出现乱码的解决》本文介绍了解决Tomcat服务输出台中文乱码问题的两种方法,第一种方法是修改`logging.properties`文件中的`prefix`和`... 目录使用TomCat,service输出台出现乱码问题1解决方案问题2解决方案总结使用TomCat,

解决IDEA使用springBoot创建项目,lombok标注实体类后编译无报错,但是运行时报错问题

《解决IDEA使用springBoot创建项目,lombok标注实体类后编译无报错,但是运行时报错问题》文章详细描述了在使用lombok的@Data注解标注实体类时遇到编译无误但运行时报错的问题,分析... 目录问题分析问题解决方案步骤一步骤二步骤三总结问题使用lombok注解@Data标注实体类,编译时

Java中使用Java Mail实现邮件服务功能示例

《Java中使用JavaMail实现邮件服务功能示例》:本文主要介绍Java中使用JavaMail实现邮件服务功能的相关资料,文章还提供了一个发送邮件的示例代码,包括创建参数类、邮件类和执行结... 目录前言一、历史背景二编程、pom依赖三、API说明(一)Session (会话)(二)Message编程客

C++中使用vector存储并遍历数据的基本步骤

《C++中使用vector存储并遍历数据的基本步骤》C++标准模板库(STL)提供了多种容器类型,包括顺序容器、关联容器、无序关联容器和容器适配器,每种容器都有其特定的用途和特性,:本文主要介绍C... 目录(1)容器及简要描述‌php顺序容器‌‌关联容器‌‌无序关联容器‌(基于哈希表):‌容器适配器‌:(

使用Python实现高效的端口扫描器

《使用Python实现高效的端口扫描器》在网络安全领域,端口扫描是一项基本而重要的技能,通过端口扫描,可以发现目标主机上开放的服务和端口,这对于安全评估、渗透测试等有着不可忽视的作用,本文将介绍如何使... 目录1. 端口扫描的基本原理2. 使用python实现端口扫描2.1 安装必要的库2.2 编写端口扫

使用Python实现操作mongodb详解

《使用Python实现操作mongodb详解》这篇文章主要为大家详细介绍了使用Python实现操作mongodb的相关知识,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、示例二、常用指令三、遇到的问题一、示例from pymongo import MongoClientf

SQL Server使用SELECT INTO实现表备份的代码示例

《SQLServer使用SELECTINTO实现表备份的代码示例》在数据库管理过程中,有时我们需要对表进行备份,以防数据丢失或修改错误,在SQLServer中,可以使用SELECTINT... 在数据库管理过程中,有时我们需要对表进行备份,以防数据丢失或修改错误。在 SQL Server 中,可以使用 SE

使用Python合并 Excel单元格指定行列或单元格范围

《使用Python合并Excel单元格指定行列或单元格范围》合并Excel单元格是Excel数据处理和表格设计中的一项常用操作,本文将介绍如何通过Python合并Excel中的指定行列或单... 目录python Excel库安装Python合并Excel 中的指定行Python合并Excel 中的指定列P

浅析Rust多线程中如何安全的使用变量

《浅析Rust多线程中如何安全的使用变量》这篇文章主要为大家详细介绍了Rust如何在线程的闭包中安全的使用变量,包括共享变量和修改变量,文中的示例代码讲解详细,有需要的小伙伴可以参考下... 目录1. 向线程传递变量2. 多线程共享变量引用3. 多线程中修改变量4. 总结在Rust语言中,一个既引人入胜又可