「JCVI教程」如何基于物种的CDS的blast结果绘制点图(dotplot)

2024-06-23 20:32

本文主要是介绍「JCVI教程」如何基于物种的CDS的blast结果绘制点图(dotplot),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

这是唐海宝老师GitHub上的JCVI工具的非官方说明书。
该工具集的功能非常多,但是教程资料目前看起来并不多,因此为了能让更多人用上那么好用的工具,我就一边探索,一边写教程

这一篇文章教大家如何利用JCVI里面的工具绘制点图,展现两个物种之间的共线性关系。

在分析之前,你需要从PhytozomeV11 下载A.thaliana和Alyrata的CDS序列,保证文件夹里有如下内容

Alyrata_384_v2.1.cds.fa.gz        Athaliana_167_TAIR10.cds.fa.gz
Alyrata_384_v2.1.gene.gff3.gz  Athaliana_167_TAIR10.gene.gff3.gz

准备最长CDS和BED文件

我们在做CDS相互比对的时候只需要有每个基因最长的转录本即可,有两种方法可以实现

方法1:自己写脚本

我用我写的一个脚本get_the_longest_transcripts.py提取每个基因的最长转录本,见 基因组共线性工具MCScanX使用说明

zcat Alyrata_384_v2.1.gene.gff3.gz | python ~/scripts/python/get_the_longest_transcripts.py > aly_lst_gene.txt
zcat Athaliana_167_TAIR10.gene.gff3.gz | python ~/scripts/python/get_the_longest_transcripts.py  > ath_lst_gene.txt

其中xxx_lst_gene.txt的格式如下, 第一列是基因名,第二列是mRNA编号,后面几列是位置信息。

$ head ath_lst_gene.txt
AT4G19470.TAIR10    AT4G19470.1.TAIR10  Chr4    10612993    10614339    -
AT5G43860.TAIR10    AT5G43860.1.TAIR10  Chr5    17630450    17632312    +
AT1G68650.TAIR10    AT1G68650.1.TAIR10  Chr1    25775741    25777874    +
AT1G28050.TAIR10    AT1G28050.1.TAIR10  Chr1    9775528 9777810 -
AT3G59880.TAIR10    AT3G59880.1.TAIR10  Chr3    22120969    22121700    +
AT1G22030.TAIR10    AT1G22030.1.TAIR10  Chr1    7759164 7760556 -
AT5G24330.TAIR10    AT5G24330.1.TAIR10  Chr5    8295147 8297068 -
AT5G43990.TAIR10    AT5G43990.2.TAIR10  Chr5    17697889    17702005    +
AT1G11410.TAIR10    AT1G11410.1.TAIR10  Chr1    3841286 3844432 +
AT4G32890.TAIR10    AT4G32890.1.TAIR10  Chr4    15875470    15876762    +

由于基因名和mRNA编号里有在提取CDS不需要的内容,因此要进行删除

sed -i 's/\.v2\.1//g' aly_lst_gene.txt
sed -i 's/\.TAIR10//g' ath_lst_gene.txt

之后我们就可以根据第二列进行提取CDS

seqkit grep -f  <(cut -f 2 ath_lst_gene.txt ) Athaliana_167_TAIR10.cds.fa.gz > ath.cds
seqkit grep -f  <(cut -f 2 aly_lst_gene.txt ) Alyrata_384_v2.1.cds.fa.gz > aly.cds

提取的CDS编号里面也有一些不需要的内容,所以也要删除

sed -i 's/\.t.*//' aly.cds
sed -i 's/\..*//' ath.cds

此外还需要基因的位置信息的bed文件

awk '{print $3"\t"$4"\t"$5"\t"$1"\t0\t"$6}' ath_lst_gene.txt | sort -k4,4V > ath.bed
awk '{print $3"\t"$4"\t"$5"\t"$1"\t0\t"$6}' aly_lst_gene.txt | sort -k4,4V > aly.bed

基于JCVI工具集

当然也可以参考「JCVI教程」如何基于编码序列或蛋白序列进行共线性分析来提取bed和cds序列,不需要用到我写的脚本。

python -m jcvi.formats.gff bed --type=mRNA --key=Name Athaliana_167_TAIR10.gene.gff3.gz  > ath.bed
python -m jcvi.formats.gff bed --type=mRNA --key=Name Alyrata_384_v2.1.gene.gff3.gz > aly.bed

对bed文件中的基因进行去重

python -m jcvi.formats.bed uniq ath.bed
python -m jcvi.formats.bed uniq aly.bed

这一步会得到aly.uniq.bedath.uniq.bed, 我们将其覆盖原文件

mv ath.uniq.bed ath.bed
mv aly.uniq.bed aly.bed

根据bed文件提取cds里的序列

# Athaliana
seqkit grep -f <(cut -f 4 ath.bed ) Athaliana_167_TAIR10.cds.fa.gz | seqkit seq -i > ath.cds
# Alyrata
seqkit grep -f <(cut -f 4 aly.bed )  Alyrata_384_v2.1.cds.fa.gz | seqkit seq -i  > aly.cds

无论是哪种方法,请保证最后有以下四个文件

$ ls ???.???
aly.bed  aly.cds  ath.bed  ath.cds

BLAST比对

相对于上一步,这一步其实非常简单了

makeblastdb -in ath.cds -out db/ath -dbtype nucl
blastn -num_threads 20  -query aly.cds -db db/ath -outfmt 6 -evalue 1e-5 -num_alignments 5 > aly_ath.blast

jcvi.compara.blastfilter对结果进行过滤

python -m jcvi.compara.blastfilter --no_strip_names aly_ath.blast --sbed ath.bed --qbed aly.bed

运行过程中有如下输出信息

19:59:15 [base] Load file `aly.bed`
19:59:16 [base] Load file `ath.bed`
19:59:16 [blastfilter] Load BLAST file `aly_ath.blast` (total 49887 lines)
19:59:16 [base] Load file `aly_ath.blast`
19:59:16 [blastfilter] running the cscore filter (cscore>=0.70) ..
19:59:16 [blastfilter] after filter (42023->26531) ..
19:59:16 [blastfilter] running the local dups filter (tandem_Nmax=10) ..
19:59:16 [blastfilter] after filter (26531->24242) ..

最后输出aly_ath.blast.filtered用于做图

python -m jcvi.graphics.blastplot aly_ath.blast.filtered --sbed ath.bed --qbed aly.bed

最后点图如下

2013053-6fbdb7b7cd866643.png
点图

这篇关于「JCVI教程」如何基于物种的CDS的blast结果绘制点图(dotplot)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1088199

相关文章

以canvas方式绘制粒子背景效果,感觉还可以

这个是看到项目中别人写好的,感觉这种写法效果还可以,就存留记录下 就是这种的背景效果。如果想改背景颜色可以通过canvas.js文件中的fillStyle值改。 附上demo下载地址。 https://download.csdn.net/download/u012138137/11249872

Steam邮件推送内容有哪些?配置教程详解!

Steam邮件推送功能是否安全?如何个性化邮件推送内容? Steam作为全球最大的数字游戏分发平台之一,不仅提供了海量的游戏资源,还通过邮件推送为用户提供最新的游戏信息、促销活动和个性化推荐。AokSend将详细介绍Steam邮件推送的主要内容。 Steam邮件推送:促销优惠 每当平台举办大型促销活动,如夏季促销、冬季促销、黑色星期五等,用户都会收到邮件通知。这些邮件详细列出了打折游戏、

X-AnyLabeling使用教程

1.AI 模型自动分割标注使用教程 2.AI 模型自动目标检测标注使用教程

青龙面板2.9之Cdle傻妞机器人编译教程

看到有的朋友对傻妞机器人感兴趣,这里写一下傻妞机器人的编译教程。 第一步,这里以linux amd64为例,去官网下载安装go语言安装包: 第二步,输入下方指令 cd /usr/local && wget https://golang.google.cn/dl/go1.16.7.linux-amd64.tar.gz -O go1.16.7.linux-amd64.tar.gz

青龙面板部署通用教程,含服务器、路由器、X86等部署方法

1. 拉取镜像/更新镜像 docker pull whyour/qinglong:latest 2. 删除镜像 docker rmi whyour/qinglong:latest 3. 启动容器 普通服务器 docker run -dit \-v $PWD/ql/config:/ql/config \-v $PWD/ql/log:/ql/log \-v $PWD/ql/db:

宝塔面板部署青龙面板教程【简单易上手】

首先,你得有一台部署了宝塔面板的服务器(自己用本地电脑也可以)。 宝塔面板部署自行百度一下,很简单,这里就不走流程了,官网版本就可以,无需开心版。 首先,打开宝塔面板的软件商店,找到下图这个软件(Docker管理器)安装,青龙面板还是安装在docker里,这里依赖宝塔面板安装和管理docker。 安装完成后,进入SSH终端管理,输入代码安装青龙面板。ssh可以直接宝塔里操作,也可以安装ssh连接

PS系统教程25

介绍软件 BR(bridge) PS 配套软件,方便素材整理、管理素材 作用:起到桥梁作用 注意:PS和BR尽量保持版本一致 下载和安装可通过CSDN社区搜索,有免费安装指导。 安装之后,我们打开照片只需双击照片,就自动在Ps软件中打开。 前提:电脑上有PS软件 三种预览格式 全屏预览 评星级 直接按数字键就可以 方向键可以更换图片 esc退出 幻灯片放

flex布局学习笔记(flex布局教程)

前端笔试⾯试经常会问到:不定宽⾼如何⽔平垂直居中。最简单的实现⽅法就是flex布局,⽗元素加上如下代码即 可: display: flex; justify-content: center; align-items :center; 。下⾯详细介绍下flex布局吧。   2009年,W3C提出了 Flex布局,可以简便⼂完整⼂响应式地实现各种页⾯布局。⽬前已得到了所有浏览器的⽀持,这意味着,现

IPython小白教程:提升你的Python交互式编程技巧,通俗易懂!

IPython是一个增强的Python交互式shell,它提供了丰富的功能和便捷的交互方式,使得Python开发和数据分析工作更加高效。本文将详细介绍IPython的基本概念、使用方法、主要作用以及注意事项。 一、IPython简介 1. IPython的起源 IPython由Fernando Pérez于2001年创建,旨在提供一个更高效的Python交互式编程环境。 2. IPyt

XMG 绘制形状

1. 除非是绘制曲线直接使用原生的。如果绘制形状直接使用UIBezerPath  2. 命名原则,类方法以类名开头 UIBezierPath bezierPathWithRect 3.圆角半径 画圆的大小 以每个顶点为圆心。给定的半径为半径画一个1/4圆。把周边的给切掉 4.只有封闭的形状调用这个方法才有用 [path fill] 5. stroke 描边一下