可视化生信分析利器-Galaxy(第一讲)

2024-06-23 21:18

本文主要是介绍可视化生信分析利器-Galaxy(第一讲),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

什么是Galaxy

很多公司开始推广他们的可视化生信分析工具,有人说未来的趋势是无代码,分析只要拖拖点点就行了。无代码只能说是一个噱头,毕竟人人都会“用"excel,也不是人人都是数据分析师。

但是一个数据分析师肯定知道如何正确的使用excel,所以一个真正的生信媛/猿也不会嫌弃那些可视化的工具。毕竟写代码累了,没事拖拖点点也是别样的乐趣。

Galaxy就是很多年前在云计算背景下诞生的开源项目, 目前在GitHub上有362个star,165个贡献者。

官方站点: https://usegalaxy.org/,如果感兴趣的话可以在云端玩耍下。

2013053-f8e8afd777c7abed.png
Galaxy

然后,将有一波galaxy学习笔记更新而来。

安装

在正式安装之前,确保自己使用的是Unix/Linux系统,并且安装了Python,且版本是2.7.(最好还有Git)。

galaxy的安装非常简单,就是从github上克隆一份到本地,然后运行部署脚本,然后等着。

# 我习惯把软件安装在biosoft下
cd ~/biosoft
# 克隆到本地
git clone -b release_17.09 https://github.com/galaxyproject/galaxy.git
cd galaxy
# 修改配置文件
cp config/galaxy.ini.sample config/galaxy.ini
# The port on which to listen.
port = 1024
# The address on which to listen.  By default, only listen to localhost (Galaxy
# will not be accessible over the network).  Use '0.0.0.0' to listen on all
# available network interfaces.
host = 0.0.0.0
# 运行
sh run.sh

我这里简单的修改了配置文件, 使其可以被内网的其他用户通过“IP:1024"的方式访问。

2013053-863ffc293b0ffe6b.jpg
image

配置

管理员账号

Galaxy后续如果要进行软件安装,管理用户等操作,就必须要先要成为管理员。

第一步: 在galaxy进行注册

2013053-cbd62a7d763475bc.jpg
image

第二步: 修改配置文件config/galaxy.ini,更改其中的admin_users.

# this should be a comma-separated list of valid Galaxy users
admin_users = user1@example.com,user2@example.com

第三步: 重启run.sh或者重新登陆账号,就会发现在工作栏上多了Admin这一部分。

安装软件

安装工具OR下载数据有三种方法:

  • 从Tool Shed安装
  • 手动添加到Galaxy中
  • 脚本自动化完成

其中从Tool shed安装最方便,官方教程介绍的非常详细,跟从APP Store下载软件没有啥太大区别。

如下演示BWA软件如何安装。

2013053-9fb25c04b580e368.jpg
image

小技巧: galaxy同样利用bioconda进行生信软件管理,因此修改galaxy/config/galaxy.ini中如下行

# conda_ensure_channels = iuc,bioconda,conda-forge,defaults,r
conda_ensure_channels = iuc,https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud/bioconda/,https://mirrors.tuna.tsinghua.edu.cn/anaconda/cloud/conda-forge/,defaults,r

这行代码仅针对国内用户,感谢清华镜像源。

可视化数据管理

数据管理是一件非常琐碎,非常基础,但是却非常重要的事情。你不能直接把数据丢在一边,假装他已经被你整理了。你必须面对这只”灰犀牛“,知道如何正确的对数据进行管理。

生信分析的数据可以分为以下几类:

  • 参考序列,注释文件,索引文件
  • 用户上传数据
  • 分析过程中所产生的数据

Galaxy建立了专门的数据管理体系,用于记录这几类数据,便于不同工具间的交互。

Part I:准备参考基因序列并建立索引。

和这部分相关的工具位于Data ManagersData source两个工具分类下。

2013053-1f9a883dd706a426.jpg
image

这一部分需要安装的工具如下,请参考安装软件一节完成安装。

  • data_manager_fetch_genome_dbkeys_all_fasta
  • data_manager_bwa_mem_index_builde
  • data_manager_bowtie2_index_builder
  • data_manager_fetch_gene_annotation
  • data_manager_hisat2_index_builder

安装完成之后,点击adminlocal data会出现如下内容。

2013053-a19f1f022dcf06c1.jpg
image

hu

拟南芥为例, 我事先在TAIR上复制了其参考基因组的下载地址, 随后在adminlocal data中选择"ata_manager_fetch_genome_dbkeys_all_fasta"进行下载。

2013053-0e879149ab36ae8d.jpg
image

hua

随后就能在如下的"Data Manager Jobs"查看运行进程。

2013053-9cac29ccb244f506.jpg
image

不难发现,其实我也是在2次失败的尝试后,才找到的正确地使用方式。但是由于我重复添加同一个物种,结果后面各种报错,于是我就只能使用了最后的绝招--重装Galaxy。

后续需要对参考基因组建立索引,过程和上面的一致,只不过你需要选择BWA-MEM index,之后就是点点然后等几分钟就行了。

如果是人类的参考基因组,可以考虑下载已有的索引,然后修改galaxy的配置文件。

Part II: 用户上传数据

用户上传数据这一块比较简单,如下图选择Upload File, 然后从本地选择需要的数据进行上传即可。

2013053-54ec15b06bc98bae.jpg
image

Part III: 中间数据。 这个部分目前不需要担心,你可以将分析结果下载到本地,然后在本地用IGV进行查看。这个部分在workflow会继续再介绍。

2013053-45ce669a6a27a1e2.jpg
image

下一讲

如何自动化安装软件?如何配置galaxy项目还没有的工具?大规模数据应该如何上传?

这些内容见下一讲吧。

这篇关于可视化生信分析利器-Galaxy(第一讲)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1088299

相关文章

kotlin中const 和val的区别及使用场景分析

《kotlin中const和val的区别及使用场景分析》在Kotlin中,const和val都是用来声明常量的,但它们的使用场景和功能有所不同,下面给大家介绍kotlin中const和val的区别,... 目录kotlin中const 和val的区别1. val:2. const:二 代码示例1 Java

Go标准库常见错误分析和解决办法

《Go标准库常见错误分析和解决办法》Go语言的标准库为开发者提供了丰富且高效的工具,涵盖了从网络编程到文件操作等各个方面,然而,标准库虽好,使用不当却可能适得其反,正所谓工欲善其事,必先利其器,本文将... 目录1. 使用了错误的time.Duration2. time.After导致的内存泄漏3. jsO

Spring事务中@Transactional注解不生效的原因分析与解决

《Spring事务中@Transactional注解不生效的原因分析与解决》在Spring框架中,@Transactional注解是管理数据库事务的核心方式,本文将深入分析事务自调用的底层原理,解释为... 目录1. 引言2. 事务自调用问题重现2.1 示例代码2.2 问题现象3. 为什么事务自调用会失效3

Python Dash框架在数据可视化仪表板中的应用与实践记录

《PythonDash框架在数据可视化仪表板中的应用与实践记录》Python的PlotlyDash库提供了一种简便且强大的方式来构建和展示互动式数据仪表板,本篇文章将深入探讨如何使用Dash设计一... 目录python Dash框架在数据可视化仪表板中的应用与实践1. 什么是Plotly Dash?1.1

找不到Anaconda prompt终端的原因分析及解决方案

《找不到Anacondaprompt终端的原因分析及解决方案》因为anaconda还没有初始化,在安装anaconda的过程中,有一行是否要添加anaconda到菜单目录中,由于没有勾选,导致没有菜... 目录问题原因问http://www.chinasem.cn题解决安装了 Anaconda 却找不到 An

Spring定时任务只执行一次的原因分析与解决方案

《Spring定时任务只执行一次的原因分析与解决方案》在使用Spring的@Scheduled定时任务时,你是否遇到过任务只执行一次,后续不再触发的情况?这种情况可能由多种原因导致,如未启用调度、线程... 目录1. 问题背景2. Spring定时任务的基本用法3. 为什么定时任务只执行一次?3.1 未启用

C++ 各种map特点对比分析

《C++各种map特点对比分析》文章比较了C++中不同类型的map(如std::map,std::unordered_map,std::multimap,std::unordered_multima... 目录特点比较C++ 示例代码 ​​​​​​代码解释特点比较1. std::map底层实现:基于红黑

基于@RequestParam注解之Spring MVC参数绑定的利器

《基于@RequestParam注解之SpringMVC参数绑定的利器》:本文主要介绍基于@RequestParam注解之SpringMVC参数绑定的利器,具有很好的参考价值,希望对大家有所帮助... 目录@RequestParam注解:Spring MVC参数绑定的利器什么是@RequestParam?@

Spring、Spring Boot、Spring Cloud 的区别与联系分析

《Spring、SpringBoot、SpringCloud的区别与联系分析》Spring、SpringBoot和SpringCloud是Java开发中常用的框架,分别针对企业级应用开发、快速开... 目录1. Spring 框架2. Spring Boot3. Spring Cloud总结1. Sprin

使用Folium在Python中进行地图可视化的操作指南

《使用Folium在Python中进行地图可视化的操作指南》在数据分析和可视化领域,地图可视化是一项非常重要的技能,它能够帮助我们更直观地理解和展示地理空间数据,Folium是一个基于Python的地... 目录引言一、Folium简介与安装1. Folium简介2. 安装Folium二、基础使用1. 创建