高通量计算框架HTCondor(一)——概述

简介: 高通量计算框架HTCondor(一)——概述

高通量计算框架HTCondor(一)——概述

目录

1. 正文

HTCondor是威斯康星大学麦迪逊分校构建的分布式计算软件和相关技术,用来处理高通量计算(High Throughput Computing )的相关问题。高通量计算中的Throughput应该是吞吐量的意思,也就是调度计算机资源的能力。与高性能计算(HPC)不同,高通量计算(HTC)应对的问题是在高性能的同时能够长时间稳定运行的能力,并充分利用集群或网络内计算资源。长时间计算时,集群或网络内计算资源往往是不可靠的,这中间蕴含了计算资源管理和任务调度的问题。

具体来说,HTC的思想就是将规模的密集运算拆分成一个个的子任务,交给集群计算机运算。HTCondor提供了如下功能:

  1. 发布任务:根据设定的集群内计算资源条件,将任务发布到集群计算机。
  2. 调度任务:任务能够发送到满足条件计算机中运行,或者迁移到另外一台计算机。
  3. 监视任务:随时监视任务运行的情况和计算资源的情况。
    注意拆分任务这一步还是需要用户自己控制的,拆分合适粒度的并行任务,有助于最大程度的负载均衡。

除此之外,一个不能忽视的的问题就是磁盘IO的问题。HTC往往伴随着海量数据,巨量数据的磁盘IO必定会造成性能瓶颈。HTCondor自带了一种文件传输机制,发布任务的时候能够自动将数据发送到对应的机器中运行。当然,也可以尝试搭配分布式文件系统如hdfs进行计算。

准备在这一系列博文中,通过一个具体的实例,总结下HTCondor的使用过程,也算对分布式计算或者集群计算有个感性的认识。

2. 目录

1.高通量计算框架HTCondor(一)——概述

简要介绍了高通量分布式计算与HTCondor。

2.高通量计算框架HTCondor(二)——环境配置

详细展示了HTCondor环境的搭建过程。

3.高通量计算框架HTCondor(三)——使用命令

介绍了HTCondor的使用环境,以及经常使用的命令。

4.高通量计算框架HTCondor(四)——案例准备

准备一个实际案例做分布式计算。

5.高通量计算框架HTCondor(五)——分布计算

使用一个实例进行简单的分布式计算。

6.高通量计算框架HTCondor(六)——拾遗

总结了使用HTCondor过程中的一些问题与建议。

3. 参考

[1]. 说说高通量计算(HTC)、高性能计算(HPC)和多任务计算(MTC)

[2]. HTCondor官网

[3]. Hadoop到底是干什么用的?

[4]. condor 使用详解

4. 相关

代码和数据地址

下一篇

分类: 分布式计算

标签: 集群计算 , 分布式计算 , HTCondor



目录
打赏
0
0
0
0
18
分享
相关文章
高通量计算框架HTCondor(五)——分布计算
高通量计算框架HTCondor(五)——分布计算
92 0
Tugraph Analytics图计算快速上手之紧密中心度算法
紧密中心度(Closeness Centrality)计量了一个节点到其他所有节点的紧密性,即该节点到其他节点的距离的倒数;节点对应的值越高表示紧密性越好,能够在图中传播信息的能力越强,可用以衡量信息流入或流出该节点的能力,多用与社交网络中关键节点发掘等场景。
重构计算,驱动视界:阿里云视觉计算思考与实践
2023年3月23日14:00(中国时间),NVIDIA GTC开发者大会阿里云开发者社区观看入口正式开放,阿里云弹性计算产品专家张新涛带来了题为《重构计算,驱动视界:阿里云视觉计算思考与实践》的分享
重构计算,驱动视界:阿里云视觉计算思考与实践
联邦学习产品及算法运行机制简介(下)
联邦学习产品及算法运行机制简介(下)
158 0
联邦学习产品及算法运行机制简介(下)
异构集群,统一计算 在微博机器学习平台的应用
内容简要: 一、微博机器学习平台简介 二、异构集群,多计算引擎–Before 三、异构集群,统一计算–Now 四、解决方案 五、机器学习流程自动化
异构集群,统一计算 在微博机器学习平台的应用