生信技巧 | GNU 并行操作

简介: 生信技巧 | GNU 并行操作

简介

有些分析需要很长时间,因为它在单个处理器上运行并且有大量数据需要处理。如果数据可以分成块并单独处理,那么问题就被认为是可并行化的。

数据并行情况

  • 当文件的每一行都可以单独处理时
  • 基因组的每条染色体都可以单独处理
  • 组件的每个脚手架都可以单独处理

处理并行

  • 压缩或解压缩 10 到 100 个文件
  • 计算大文件中的行数
  • 将许多样本的原始测序数据文件与基因组进行比对

不能并行的情况

基因组组装并不是简单的可并行化,因为第一步需要将每个读数与其他读数进行对齐,以便找到哪些读数相似并且应该连接(组装)。获取读取的子集会导致低质量的组装结果。

GNU 并行

我们用来并行化生物信息学问题的程序是 GNU 并行。它是“一种使用一个或多个计算节点并行执行作业的 shell 工具”。 GNU 并行可帮助您运行原本要按顺序一项一项或循环运行的作业。您可以查看 GNU Parallel 网站,以确定如何在集群上安装 Parallel 和/或了解如何使用它。

  • ubuntu安装
sudo apt update  # 更新包列表
sudo apt install parallel

# 版本查看
parallel --version
  • 集群,我们加载模块并查看版本
# 集群load 模块
module load parallel  

# 版本查看
parallel --version

普通情况

我们将使用纽约时报 github 存储库整理的 COVID-19 数据

mkdir GNU-parallel
cd GNU-parallel
wget https://raw.githubusercontent.com/nytimes/covid-19-data/master/us-counties.csv

这是一个逗号分隔的文件,所以让我们将其转换为制表符分隔的文件

more us-counties.csv  | tr ',' '\t' > us-counties.tab

如您所见,此数据包含各县和州有关疫情随时间变化的信息。

head us-counties.tab

让我们按县/州分开这些数据,而不是一个大文件

使用 sort 和 awk,我们可以首先按县/州对文件进行排序,然后使用 awk 将每一行 ($0) 打印到名为 County-state.tab 的文件中。

sort -k 2,3 us-counties.tab | awk '{print $0 > $2"-"$3".tab"}'

这将生成 2578 个文件 + 我们下载的原始 2 个文件

ls | wc

2580    2580   50550  # 输出结果

GNU示例

  • Gzip 压缩 2580 个文本文件

让我们复制数据并比较使用 for 循环与使用并行运行 gzip 需要多长时间

mkdir -p gzip/parallel
mkdir -p gzip/forloop
cp *.tab gzip/parallel
cp *.tab gzip/forloop
  • GNU 并行/gzip/forloop
cd gzip/forloop
time for f in *.tab; do gzip $f; done
real    0m15.801s
user    0m1.414s
sys     0m5.045s

然而,我们可以通过使用 GNU 并行来更好地利用所有可用的 CPU。该函数的使用方法是:

  • 并行命令
  • -j10 用于处理的作业或 cpu 数量。这里我们使用 10 个 cpu。
  • 在本例中,“command”为 gzip {},其中 {} 是占位符,用于替换分隔符后定义的文件列表
  • ':::' 分隔符
  • .tab 文件列表,对以 tab 结尾的任何文件使用 运算符
parallel -j10 "gunzip {}" ::: *.tab.gz

real    0m5.519s
user    0m0.376s
sys     0m1.367s

正如您所看到的,这将 gziping 命令的速度提高了 2.3 倍。这可能会有所不同,具体取决于您拥有的 CPU 数量及其速度。

相关文章
|
7月前
|
Linux 编译器 C语言
《Linux从练气到飞升》No.05 Linux编译器gcc/g++的使用及编译过程 【云边有个小卖部】上新
《Linux从练气到飞升》No.05 Linux编译器gcc/g++的使用及编译过程 【云边有个小卖部】上新
162 0
|
6月前
|
Linux Unix 程序员
02. 【Linux教程】GNU 项目简介
02. 【Linux教程】GNU 项目简介
89 0
|
7月前
|
安全 Linux Shell
Linux:探索开源之魅与编程之道
Linux:探索开源之魅与编程之道
46 4
|
7月前
|
消息中间件 关系型数据库 MySQL
Linux:开源之魅与编程之道
Linux:开源之魅与编程之道
52 1
|
7月前
|
IDE Linux 开发工具
《Linux从练气到飞升》No.06 Linux项目自动化构建工具 make/Makefile 【云边有个小卖部】上新啦
《Linux从练气到飞升》No.06 Linux项目自动化构建工具 make/Makefile 【云边有个小卖部】上新啦
95 0
|
数据采集 弹性计算 数据可视化
GWAS全基因组关联分析工具GAPIT最新版!详细安装教程与报错解决方案笔记(Linux版)
GWAS全基因组关联分析工具GAPIT最新版!详细安装教程与报错解决方案笔记(Linux版)
|
Linux 编译器 开发工具
【Linux取经路】基础开发工具——gcc/g++篇
【Linux取经路】基础开发工具——gcc/g++篇
104 0
|
Web App开发 Ubuntu Shell
linux中常见工具安装问题集锦(一)
经常和服务器打交道的同学,特别是服务器运维和开发的同学,会经常使用到一些工具和命令。然而,有时候一些新机器或者“有待考究的机器”可能啥都没有,就需要我们手动去安装相应的工具。你还别说,平时用的非常熟悉的工具,说到安装它们?一开始还真把我愁坏了,后来习惯了就好啦,哈哈。因此,整理了一些内容记录下来,方便日后查阅。
885 0
|
Ubuntu 计算机视觉
OpenCV开发笔记(七十四):OpenCV3.4.1+ffmpeg3.4.8交叉编译移植到海思平台Hi35xx平台
OpenCV开发笔记(七十四):OpenCV3.4.1+ffmpeg3.4.8交叉编译移植到海思平台Hi35xx平台
OpenCV开发笔记(七十四):OpenCV3.4.1+ffmpeg3.4.8交叉编译移植到海思平台Hi35xx平台