GATK Cromwell +WDL学习

2024-03-28 21:18
文章标签 学习 gatk cromwell wdl

本文主要是介绍GATK Cromwell +WDL学习,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

WDL (一个workflow description language)+ Cromwell(an execution engine that can run WDL scripts)是目前可以更好使用GATK的一套工具。这里学习wdl的快速入门教程。
我这里使用sublime text3,因此设置新的wdl对应的高亮。根据package control 下载package control包。在sublime text里Preference-> package control -> install package -> wdl syntax 安装。

WDL
Base structure
  • Top-level components: workflow, task and call
    workflow在顶层,用calls去执行tasks。tasks在workflow模块外被定义。
workflow myWorkFlowName {call task_Acall task_B
}
task task_A{...}
task task_B{...}
  • Core task-level components: command and output
    task的核心成分:command被运行,output明确指出哪一部分命令组成了输出。
task task_A {command {...}output {...}
}
Add Variables

有2种不同层次的variables,一种存在于task,一种存在于整个workflow。variable也可以从一个task传递到下一个task。
- Adding task-level variables

task task_A {File refFile inString idcommand {do_stuff R=${ref} I=${in} O=${id}.ext}output {File out="${id}.ext"}
}
  • Adding workflow-level variables
workflow myWorkflowName {File my_refFile my_inputString namecall task_A {input: ref=my_ref, in=my_input, id=name}call task_B {input: ref=my_ref, in=task_A.out}
}
task task_A{...}
task task_B{...}
Adding Plumbing

simple connections linear or simple branching and merging
Switching and iterating logic switch between alternate pathways and iterate over sets of data, either in series or in parallel. scatter-gather parallelism
Efficiency through code re-use
- Linear Chaining
在call里面就要开始定义前一个的结果

call stepB {input: in=stepA.out}
call stepC {input: in=stepB.out}
  • Multi-input/Multi-output
    这里写图片描述
call stepC {input: in1=stepB.out1, in2=stepB.out2}
  • Branch & Merge
    这里写图片描述
call stepB {input: in=stepA.out}
call stepC {input: in=stepA.out}
call stepD {input: in1=stepB.out, in2=stepC.out}
  • Scatter-Gather
    这里写图片描述
    Parallelism即平行可以使得任务更快,而非顺序进行。我们使用了基于WDL standard library的scatter,会产生可平行的任务(成为一列Input,array),并且会输出结果(也是array)。Scatter这个过程是外显的(explicit),而gather这个过程是不外显的(implicit)。
Array[file] inputFilessactter (oneFile in inputFiles) {call stepA {input: in=oneFile}}call stepB {input: files=stepA.out}
  • Task Aliasing
    这里写图片描述
    如果有一些copy-paste的任务,可以用task aliasing避免重复粘贴命令。
call stepA as firstSample {input: in=firstInput}
call stepA as secondSample {input: in=secondInput}
call stepB {input: in=firstSample.out}
call stepB {input: in=secondSample.out}
Validate Syntax

validate于脚本:

$java -jar wdltool.jar validate myWorkflow.wdl

例子:error if a call references a task that doesn’t exist:

$java -jar wdltool.jar validate myWorkflow.wdl
ERROR: Call references a taks (BADps) that doesn't exist (line 22, col 8)call BADps^
Specify Inputs

相比于直接输入input,这里可以用JSON文件为所有输入变量规定值。
- Generating the template JSON
我们可以用wdltool inputs函数:

java -jar wdltool.jar inputs myWorkflow.wdl > myWorkflow_inputs.json

结果:

{"<workflow name>.<task name>.<variable name>": "<variable type>"
}
  • Customizing the inputs file for a particular run
    要注意<variable type>在最初得到的template里只是提醒变量的类型,在实际使用中要改为相应的文件或者名字。但是,也要取名比较好辨认,这样避免回到脚本里对看究竟是哪个变量。比如:
{"myWorkflowName.stepA.input_file": "File""myWorkflowName.stepA.sample_name": "String"
}

那么,如果一个文件叫input.bam,样本名字叫NA12878,那么我们应该对应修改如下:

{"myWorkflowName.stepA.input_file": "~/path/to/input.bam""myWorkflowName.stepA.sample_name": "NA12878"
}
Execute!
  • Cromwell
    使用Cromwell。Cromwell是一个开源的由Java编写支持WDL的执行工具。可以在3个平台支持支持WDL的执行:本地机器,本地服务器集群,云平台。需要java 8
    基本命令:
java -jar cromwell.jar <action> <parameters>
  • Running WDL on Cromwell locally
java -jar Cromwell.jar run myWorkflow.wdl --inputs myWorkflow_inputs.json

这篇关于GATK Cromwell +WDL学习的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/856719

相关文章

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

重新对Java的类加载器的学习方式

《重新对Java的类加载器的学习方式》:本文主要介绍重新对Java的类加载器的学习方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、介绍1.1、简介1.2、符号引用和直接引用1、符号引用2、直接引用3、符号转直接的过程2、加载流程3、类加载的分类3.1、显示

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

Java进阶学习之如何开启远程调式

《Java进阶学习之如何开启远程调式》Java开发中的远程调试是一项至关重要的技能,特别是在处理生产环境的问题或者协作开发时,:本文主要介绍Java进阶学习之如何开启远程调式的相关资料,需要的朋友... 目录概述Java远程调试的开启与底层原理开启Java远程调试底层原理JVM参数总结&nbsMbKKXJx

Java深度学习库DJL实现Python的NumPy方式

《Java深度学习库DJL实现Python的NumPy方式》本文介绍了DJL库的背景和基本功能,包括NDArray的创建、数学运算、数据获取和设置等,同时,还展示了如何使用NDArray进行数据预处理... 目录1 NDArray 的背景介绍1.1 架构2 JavaDJL使用2.1 安装DJL2.2 基本操

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;