ACK上使用抢占式实例训练模型

简介: 模型训练通常会使用GPU,而GPU价格是较高的,为了降低模型训练的费用成本,可以使用阿里云抢占式实例运行训练任务。本文介绍如何使用Arena在阿里云ACK上,基于ECS抢占式实例,运行训练任务。

环境准备

  1. 在阿里云ACK上创建集群,集群规格选择Pro版,Kubernetes版本选择1.20或以上版本。
  2. 在ACK控制台,点击左侧菜单应用 - AI工程加速,进入云原生AI套件安装页面。
  3. 点击一键部署,交互方式中默认已勾选Arena,其他组件可根据需要自行勾选安装。
  4. 点击页面最下方部署云原生AI套件按钮即可,安装成功后,可以在组件管理页面看到当前安装的组件信息。

基于ECS抢占式实例的训练任务

使用ECS抢占式实例训练模型,需要先在ACK中创建节点池,并给节点池打标。然后在Arena提交训练任务时,通过--selector 参数指定把训练任务调度到抢占式实例上。


操作步骤如下:

  1. 在ACK控制台,点击左侧菜单节点管理 - 节点池,进入节点池页面。首次创建节点池,需要先点击页面右上角集群自动弹性伸缩配置按钮,根据提示完成配置。


  1. 在节点池页面,点击右上角创建节点池按钮,在弹出的创建节点池窗口中完成配置。其中付费类型要选择抢占式实例

11111111.png


然后点击页面最下方的显示高级选项。

2222222.png


在展开的配置项中,节点标签部分,为节点添加标签,这样节点池中的所有抢占式实例都被打上了instance=spot的标签。

3333333.png


最后指定节点池中实例规格和数量,点击确认配置,完成节点池创建。


  1. 使用Arena提交训练任务到抢占式实例上,这里以提交一个tensorflow单机训练任务为例说明。
arena \
  submit \
  tfjob \
--gpus=1 \
--selector=instance=spot \
--name=tf-standalone-test-with-git \
--env=TEST_TMPDIR=code/tensorflow-sample-code/ \
--sync-mode=git \
--sync-source=https://github.com/happy2048/tensorflow-sample-code.git \
--logdir=/training_logs \
--image="registry.cn-beijing.aliyuncs.com/ai-samples/tensorflow:1.5.0-devel-gpu" \
"'python code/tensorflow-sample-code/tfjob/docker/mnist/main.py --max_steps 5000'"

执行上面的命令,注意其中的--selector=instance=spot参数,通过设置该参数就可以把训练任务调度到抢占式实例上。

相关实践学习
通过Ingress进行灰度发布
本场景您将运行一个简单的应用,部署一个新的应用用于新的发布,并通过Ingress能力实现灰度发布。
容器应用与集群管理
欢迎来到《容器应用与集群管理》课程,本课程是“云原生容器Clouder认证“系列中的第二阶段。课程将向您介绍与容器集群相关的概念和技术,这些概念和技术可以帮助您了解阿里云容器服务ACK/ACK Serverless的使用。同时,本课程也会向您介绍可以采取的工具、方法和可操作步骤,以帮助您了解如何基于容器服务ACK Serverless构建和管理企业级应用。 学习完本课程后,您将能够: 掌握容器集群、容器编排的基本概念 掌握Kubernetes的基础概念及核心思想 掌握阿里云容器服务ACK/ACK Serverless概念及使用方法 基于容器服务ACK Serverless搭建和管理企业级网站应用
目录
相关文章
|
4月前
|
Kubernetes 负载均衡 网络安全
Kubernetes 网络模型与实践
【8月更文第29天】Kubernetes(K8s)是当今容器编排领域的佼佼者,它提供了一种高效的方式来管理容器化应用的部署、扩展和运行。Kubernetes 的网络模型是其成功的关键因素之一,它支持服务发现、负载均衡和集群内外通信等功能。本文将深入探讨 Kubernetes 的网络模型,并通过实际代码示例来展示服务发现和服务网格的基本概念及其实现。
125 1
|
4月前
|
Kubernetes 负载均衡 安全
在k8S中,网络模型概念是什么?
在k8S中,网络模型概念是什么?
|
4月前
|
Kubernetes Shell 网络安全
【Azure K8S】记录AKS VMSS实例日志收集方式
【Azure K8S】记录AKS VMSS实例日志收集方式
|
4月前
|
Kubernetes 网络虚拟化 容器
在K8S中,cailico的ipip模型和ciliume的vxlan模型除了在具体的实现不同,在原理上有何区别?
在K8S中,cailico的ipip模型和ciliume的vxlan模型除了在具体的实现不同,在原理上有何区别?
|
4月前
|
Kubernetes 安全 Linux
在K8S中,calico和cilium这两种cni有什么区别?cailico的ipip模型和ciliume的vxlan模型,两种不通模型性能也不同,它们怎么处理数据的?
在K8S中,calico和cilium这两种cni有什么区别?cailico的ipip模型和ciliume的vxlan模型,两种不通模型性能也不同,它们怎么处理数据的?
|
4月前
|
存储 Kubernetes 容器
在k8S中,CSI模型是什么?
在k8S中,CSI模型是什么?
|
4月前
|
JSON Kubernetes Cloud Native
在k8S中,CNI模型概念是什么?
在k8S中,CNI模型概念是什么?
|
5月前
|
JSON Kubernetes 网络架构
Kubernetes CNI 网络模型
【7月更文挑战第5天】CNI定义了容器运行时与插件间的简单交互,允许容器加入多个网络,通过JSON配置。
|
容器
阿里云最新产品手册——云基础产品与基础设施——计算——弹性容器实例——通用部署ACK虚拟节点组件创建ECI Pot——ECI Pot——特殊实例
阿里云最新产品手册——云基础产品与基础设施——计算——弹性容器实例——通用部署ACK虚拟节点组件创建ECI Pot——ECI Pot——特殊实例自制脑图
395 4
|
7月前
|
Kubernetes 应用服务中间件 nginx
Kubernetes服务网络Ingress网络模型分析、安装和高级用法
Kubernetes服务网络Ingress网络模型分析、安装和高级用法
160 5