15分钟并行神器gnu parallel入门指南

GNU Parallel是一个shell工具,为了在一台或多台计算机上并行的执行计算任务。本文简要介绍GNU Parallel的使用。

这个cpu是多核的。

一般两核是这样工作的的:

四核是这样工作的:

16核是这样工作的:

好了不黑了。再黑intel要打我了。

在某个周末的早上百无聊赖之际,花了半天时间过了一遍gnu parallel的man page和tutorial。哈哈,我得说这半天时间花的应该挺值,因为感觉以后它能为我节省的时间不止半天吧。

本文并不会尝试去翻译gnu parallel的man page或者tutorial。因为现成的翻译已经有了,可以看这里,或者这里。

但是我前几次看到 parallel诡异的几个:::以及奇奇怪怪的 {}{#}{.}{\}占位符之后就打起了退堂鼓,如此丑陋的语法令人无爱啊。还好直接看了一下几个example压压惊,动手试一把,才发现实乃神器也。

本文主要的目的是安利(lure)你使用这个工具,并且告诉你为啥(why)使用和如何(how)使用。

why

使用gnu parallel的目的只要一个,就是为了快!

安装快

(wget -O - pi.dk/3 || curl pi.dk/3/) | bash

作者说10秒装好。在国内实际情况可能不够。但是也不用太久。其实就是一个1万多行perl单文件脚本(是的,你没看错,所有模块都在这个文件里,这是一个特色~)。我之后都是写fabric脚本直接拷贝到各个节点机。再chmod一下执行权限。
然后是执行快,它将你的程序并行利用系统的多核执行:
上图:

grep 一个  1G 大小的log。

使用parallel  ,和不使用parallel直接grep。结果显而易见,相差 20 倍。这比用啥 ack,ag优化效果明显多了。

备注:这是在一个48 核服务器上执行的结果。

how

最简单的方法就是类比xargs。在xargs里面有一个参数 -P,可以利用多核。

举个例子:

$ time echo {1..5} |xargs -n 1 sleep

real 0m15.005s
user 0m0.000s
sys 0m0.000s

这一条xargs把每个echo的数作为参数传给sleep ,所以一共sleep了 1+2+3+4+5=15秒。

如果使用 -P 参数分给5个核,每个核各sleep 1,2,3,4,5秒,所以执行完之后总共sleep的5秒。

$ time echo {1..5} |xargs -n 1 -P 5 sleep

real 0m5.003s
user 0m0.000s
sys 0m0.000s

铺垫结束。一般情况下,parallel的第一种模式,就是替换掉 xargs -P.

比如压缩一下所有的html文件。

find . -name '*.html' | parallel gzip --best

传参数模式

第一种模式是利用 parallel传参数。管道前面进来的作为参数传给后面的命令,并行执行

比如

huang$ seq 5 | parallel echo pre_placehoder_{}
pre_placehoder_1
pre_placehoder_2
pre_placehoder_3
pre_placehoder_4
pre_placehoder_5

其中{}是占位符,用来占位传入参数的位置。

在云计算操作中,经常有批量操作,比如建立10个云硬盘

seq 10 | parallel cinder create 10 --display-name test_{}

建立50个云主机

代码如下:

seq 50 | parallel nova boot --image    image_id  --flavor 1 --availability-zone  az_id   --nic vnetwork=private   --vnc-password 000000  vm-test_{}

批量删除云主机

nova list | grep some_pattern| awk '{print $2}' | parallel nova delete

改写 for loop

可以看到,我其实是把很多需要写循环的地方用parallel替换了,顺带享受了并行带来的快捷。
这个道理是这样的,在进行for循环的时候,是最有可能并行化的,因为被放在循环中的各个对象是上下文无关的。

普世抽象,shell的循环:

 (for x in `cat list` ; do
 do_something $x
 done) | process_output

可以直接写成

 cat list | parallel do_something | process_output

如果loop 里面内容太多了

 (for x in `cat list` ; do
 do_something $x
 [... 100 lines that do something with $x ...]
 done) | process_output

那么最好写成一个脚本

 doit() {
 x=$1
 do_something $x
 [... 100 lines that do something with $x ...]
 }
 export -f doit
 cat list | parallel doit

而且还能避免掉很多麻烦的转义。

--pipe模式

另一种模式就是 parallel --pipe

这时管道前面的不是作为参数,而是标准输入传给后面的命令

例如:

cat my_large_log |parallel --pipe grep pattern

如果不加 --pipe ,相当于 mylog中的每一行都变成 grep pattern line的命令展开了。而加入了--pipe,则和 cat mylog | grep pattern  没有区别,只是分配到各个核上去执行了。

好了,基本概念就讲完了!其他的都只是各个参数具体使用,比如到底用几个核啊,place_holder的替换啊,各种花样传参数啊,并行执行但是保证结果顺序输出(-k),以及神奇的跨节点并行计算啊,看看man page就知道了。

bonus

手边有了一个转换成并行的小工具,除了让你日常执行快一点之外,还有一个好处,就是测并发。

很多接口在并发操作下会出现一些bug,比如有一些判断数据库里面没有加锁,是在代码层面判断的,结果并发请求下去,每个请求在到达服务器的时候是判断通过,一起写了之后就超出限制了。之前写for循环因为是串行执行的,并不会触发这些问题。但是你要真正测并发的话,又要写脚本,或者利用python的mulitiprocessing封装一下。但我手边有了parallel,又在bashrc里面就加了以下两个alias

alias p='parallel'
alias pp='parallel --pipe -k'

这样制造并发太方便了,只需要管道后面加个p , 我就时时刻刻可以制造并发来观察响应。

举个例子

seq 50 | p -n0 -q curl 'example.com'

以你核的个数并发请求。-n0的意思是seq输出不作为参数传给后面的命令。

八卦时间:gnu界的祥林嫂

作为一个自由软件八卦爱好者,每次我发现一个新奇的软件总会去 google一下 关键词 site:https://news.ycombinator.com关键词 site:http://www.reddit.com/。看看风评如何,并且往往还能在讨论中有意外收获。

然后我再hacker news上看到了一段吐槽,主要就是说每次触发执行parallel都会弹出一段文字和你说,要是你把这个工具用在学术上的话(很多生命科学相关的都在用这个工具的),要引用他的论文,不然的话你就付他10000欧元吧。我因此学到一个词,叫Nagware,特指通过啰啰嗦嗦像唐僧那样烦你要你付钱的软件。虽然我认为真用到了的确也应该引用一下文章,但是,如同这位同学说的:

I agree it's a great tool, except for the nagware messages and their  content. Imagine if the author of cd or ls had the same attitude...

另外,该作者真是灰常喜欢别人引用他的软件,以致于在NEWS里面我还看到了:

原理时间

直接摘抄一下作者在 stackoverflow 的回答

GNU Parallel is a general parallelizer and makes is easy to run jobs in parallel on the same machine or on multiple machines you have ssh access to.

If you have 32 different jobs you want to run on 4 CPUs, a straight forward way to parallelize is to run 8 jobs on each CPU:

GNU Parallel instead spawns a new process when one finishes - keeping the CPUs active and thus saving time:

结论

本文主要安利了一个 真 - 并行 工具,解释了其主要的两种模式,附赠了一个技巧,八卦了gnu界不为人知的另一面。希望对你有用。

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持我们。

(0)

相关推荐

  • 15分钟并行神器gnu parallel入门指南

    GNU Parallel是一个shell工具,为了在一台或多台计算机上并行的执行计算任务.本文简要介绍GNU Parallel的使用. 这个cpu是多核的. 一般两核是这样工作的的: 四核是这样工作的: 16核是这样工作的: 好了不黑了.再黑intel要打我了. 在某个周末的早上百无聊赖之际,花了半天时间过了一遍gnu parallel的man page和tutorial.哈哈,我得说这半天时间花的应该挺值,因为感觉以后它能为我节省的时间不止半天吧. 本文并不会尝试去翻译gnu parallel

  • GNU Parallel的具体使用

    它是什么? GNU Parallel是一个shell工具,为了在一台或多台计算机上并行的执行计算任务,一个计算任务可以是一条shell命令或者一个以每一行做为输入的脚本程序.通常的输入是文件列表.主机列表.用户列表.URL列表或者表格列表:一个计算任务也可以是一个从管道读取的一条命令.GNU Parallel会把输入分块,然后通过管道并行的执行. 如果你会使用xargs和tee命令,你会发现GNU Parallel非常易于使用,因为GNU Parallel具有与xargs一样的选项.GNU Pa

  • 手把手15分钟搭一个企业级脚手架

    1 写在前面的话 搭一个脚手架,考验了你的 nodejs 水平.工程化能力.以及工具服务的设计能力,是前端进阶不可或缺的过程 笔者在开发 cli 的过程中,调研流行的 cli 并形成最佳实践,本文旨在用最短的篇幅实现主要功能,揭露核心原理,同时提供 demo 仓库与大家学习探讨. 通篇阅读大约需要 10 分钟,基于本教程自己撸一个 cli 大约需要花费 15 分钟 2 脚手架的雏形 其实脚手架的初衷,就是提供一个最佳实践的基础模板,因此模板拷贝是其核心功能 几年前我曾写过一个极简的脚手架,大该干

  • Oracle RMAN快速入门指南

    正在看的ORACLE教程是:Oracle RMAN快速入门指南.前言: 这篇文章主要介绍RMAN的常用方法,其中包含了作者一些自己的经验,里面的实验也基本全在WIN 2K和ORACLE 8.1.6环境下测试成功(因为这个环境比较容易实现). 本文借鉴了网上一些高手的相关文章,希望大侠们不要见怪,此处一并谢过. 这篇文章主要是在北京出差期间写的,回到家后整理修改了一下,时间比较仓促,同时因为篇幅有限,一些技术细节不能一一覆盖了,只希望能够帮助新手入门的作用,想真正熟练掌握RMAN,必须经过较长时间

  • 如何利用多核CPU来加速你的Linux命令(GNU Parallel)

    你是否曾经有过要计算一个非常大的数据(几百GB)的需求?或在里面搜索,或其它操作--一些无法并行的操作.数据专家们,我是在对你们说.你可能有一个4核或更多核的CPU,但我们合适的工具,例如 grep, bzip2, wc, awk, sed 等等,都是单线程的,只能使用一个CPU内核. 借用卡通人物Cartman的话,"如何我能使用这些内核"? 要想让Linux命令使用所有的CPU内核,我们需要用到GNU Parallel命令,它让我们所有的CPU内核在单机内做神奇的map-reduc

  • 15 分钟掌握vue-next函数式api(小结)

    写在前面 在分享 vue-next 各个子模块的实现之前,我觉的有必要比较全面的整理下 vue-next 中提出的函数式 api,了解这些的话,无论是对于源码的阅读,还是当正式版发布时开始学习,应该都会有起到一定的辅助作用. 类似的东西在网上有很多,只是会比较零碎,同时有些也相对过时了,当然当前整理的这些也有可能会过时,毕竟代码还处于 pre-alpha 的阶段,但其中的设计思想应该是不会改变了. 往期文章 15 分钟掌握 vue-next 响应式原理 vue-next/runtime-core

  • 15分钟上手vue3.0(小结)

    Vue 3 还没有正式发布,但是 Alpha 版本已经发布了. 虽然官方还不推荐在生产环境中直接使用 Vue 3 ,但是提前学习总归是有好处的. 嘴上喊着老子学不动了,双手还是很诚实的打开了 Vue 3 文档 创建项目 Vue 官方很贴心的提供了一个 github 仓库,让我们能快速体验Vue 3的新特性: git clone https://github.com/vuejs/vue-next-webpack-preview.git vue3-start cd vue3-start npm in

  • Mybatis入门指南之实现对数据库增删改查

    目录 前言 MyBatis 简介 优点 缺点 搭建第一个Mybatis程序 新建项目. 引入pom.xml依赖. 新建数据库数据表. 新建Student实体类. 配置Mybatis的配置文件. 创建StudentMapper.xml文件. 在config.xml中加入mapper. 调用Mybitis原生接口进行操作 增 删 改 查 总结 前言 我们关于Spring和Spring MVC的学习也有一段时间了,都还没有进行过数据库的操作,而在实际项目中数据库是必不可少的部分,所以我们接下来将来学习

  • 15分钟提醒一次,珍惜时间啊

    15分钟提醒一次,珍惜时间啊保存为.vbs 复制代码 代码如下: today=Date() years=DatePart("yyyy",today)-1981-1 Days=DatePart("y",today)+25 If DatePart("m",today)=12 Then  if DatePart("d",today)>=9 Then  MsgBox "ok"  Years=Years+1  

  • 如何使用 Rails 和七牛云存储,在 15 分钟内打造一个图片分享社交应用原型

    十年前,Web 应用框架 Rails 创始人 David Heinemeier Hansson 曾录制视频,向我们演示如何使用 Ruby on Rails 在 15 分钟内创作一个 blog 引擎.这个视频通过 Rails 优秀的 MVC .习惯优于配置(Convention over Configuration)等设计,以及强大的代码生成.scaffold 等功能,成功展示了 Ruby on Rails 编写 Web 应用核心功能的高效简洁.Ruby on Rails 这门技术也在 Web 2

随机推荐