ACK上使用抢占式实例训练模型

简介: 模型训练通常会使用GPU,而GPU价格是较高的,为了降低模型训练的费用成本,可以使用阿里云抢占式实例运行训练任务。本文介绍如何使用Arena在阿里云ACK上,基于ECS抢占式实例,运行训练任务。

环境准备

  1. 在阿里云ACK上创建集群,集群规格选择Pro版,Kubernetes版本选择1.20或以上版本。
  2. 在ACK控制台,点击左侧菜单应用 - AI工程加速,进入云原生AI套件安装页面。
  3. 点击一键部署,交互方式中默认已勾选Arena,其他组件可根据需要自行勾选安装。
  4. 点击页面最下方部署云原生AI套件按钮即可,安装成功后,可以在组件管理页面看到当前安装的组件信息。

基于ECS抢占式实例的训练任务

使用ECS抢占式实例训练模型,需要先在ACK中创建节点池,并给节点池打标。然后在Arena提交训练任务时,通过--selector 参数指定把训练任务调度到抢占式实例上。


操作步骤如下:

  1. 在ACK控制台,点击左侧菜单节点管理 - 节点池,进入节点池页面。首次创建节点池,需要先点击页面右上角集群自动弹性伸缩配置按钮,根据提示完成配置。


  1. 在节点池页面,点击右上角创建节点池按钮,在弹出的创建节点池窗口中完成配置。其中付费类型要选择抢占式实例

11111111.png


然后点击页面最下方的显示高级选项。

2222222.png


在展开的配置项中,节点标签部分,为节点添加标签,这样节点池中的所有抢占式实例都被打上了instance=spot的标签。

3333333.png


最后指定节点池中实例规格和数量,点击确认配置,完成节点池创建。


  1. 使用Arena提交训练任务到抢占式实例上,这里以提交一个tensorflow单机训练任务为例说明。
arena \
  submit \
  tfjob \
--gpus=1 \
--selector=instance=spot \
--name=tf-standalone-test-with-git \
--env=TEST_TMPDIR=code/tensorflow-sample-code/ \
--sync-mode=git \
--sync-source=https://github.com/happy2048/tensorflow-sample-code.git \
--logdir=/training_logs \
--image="registry.cn-beijing.aliyuncs.com/ai-samples/tensorflow:1.5.0-devel-gpu" \
"'python code/tensorflow-sample-code/tfjob/docker/mnist/main.py --max_steps 5000'"

执行上面的命令,注意其中的--selector=instance=spot参数,通过设置该参数就可以把训练任务调度到抢占式实例上。

相关实践学习
深入解析Docker容器化技术
Docker是一个开源的应用容器引擎,让开发者可以打包他们的应用以及依赖包到一个可移植的容器中,然后发布到任何流行的Linux机器上,也可以实现虚拟化,容器是完全使用沙箱机制,相互之间不会有任何接口。Docker是世界领先的软件容器平台。开发人员利用Docker可以消除协作编码时“在我的机器上可正常工作”的问题。运维人员利用Docker可以在隔离容器中并行运行和管理应用,获得更好的计算密度。企业利用Docker可以构建敏捷的软件交付管道,以更快的速度、更高的安全性和可靠的信誉为Linux和Windows Server应用发布新功能。 在本套课程中,我们将全面的讲解Docker技术栈,从环境安装到容器、镜像操作以及生产环境如何部署开发的微服务应用。本课程由黑马程序员提供。     相关的阿里云产品:容器服务 ACK 容器服务 Kubernetes 版(简称 ACK)提供高性能可伸缩的容器应用管理能力,支持企业级容器化应用的全生命周期管理。整合阿里云虚拟化、存储、网络和安全能力,打造云端最佳容器化应用运行环境。 了解产品详情: https://www.aliyun.com/product/kubernetes
目录
相关文章
|
Kubernetes 负载均衡 网络安全
Kubernetes 网络模型与实践
【8月更文第29天】Kubernetes(K8s)是当今容器编排领域的佼佼者,它提供了一种高效的方式来管理容器化应用的部署、扩展和运行。Kubernetes 的网络模型是其成功的关键因素之一,它支持服务发现、负载均衡和集群内外通信等功能。本文将深入探讨 Kubernetes 的网络模型,并通过实际代码示例来展示服务发现和服务网格的基本概念及其实现。
699 3
|
存储 人工智能 物联网
ACK Gateway with AI Extension:大模型推理的模型灰度实践
本文介绍了如何使用 ACK Gateway with AI Extension 组件在云原生环境中实现大语言模型(LLM)推理服务的灰度发布和流量分发。该组件专为 LLM 推理场景设计,支持四层/七层流量路由,并提供基于模型服务器负载感知的智能负载均衡能力。通过自定义资源(CRD),如 InferencePool 和 InferenceModel,可以灵活配置推理服务的流量策略,包括模型灰度发布和流量镜像。
|
存储 测试技术 对象存储
使用容器服务ACK快速部署QwQ-32B模型并实现推理智能路由
阿里云最新发布的QwQ-32B模型,通过强化学习大幅度提升了模型推理能力。QwQ-32B模型拥有320亿参数,其性能可以与DeepSeek-R1 671B媲美。
|
存储 Kubernetes 测试技术
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
867 12
|
存储 Kubernetes 测试技术
企业级LLM推理部署新范式:基于ACK的DeepSeek蒸馏模型生产环境落地指南
本教程演示如何在ACK中使用vLLM框架快速部署DeepSeek R1模型推理服务。
|
Kubernetes 负载均衡 安全
在k8S中,网络模型概念是什么?
在k8S中,网络模型概念是什么?
|
Kubernetes Shell 网络安全
【Azure K8S】记录AKS VMSS实例日志收集方式
【Azure K8S】记录AKS VMSS实例日志收集方式
279 0
|
Kubernetes 网络虚拟化 容器
在K8S中,cailico的ipip模型和ciliume的vxlan模型除了在具体的实现不同,在原理上有何区别?
在K8S中,cailico的ipip模型和ciliume的vxlan模型除了在具体的实现不同,在原理上有何区别?
|
Kubernetes 安全 Linux
在K8S中,calico和cilium这两种cni有什么区别?cailico的ipip模型和ciliume的vxlan模型,两种不通模型性能也不同,它们怎么处理数据的?
在K8S中,calico和cilium这两种cni有什么区别?cailico的ipip模型和ciliume的vxlan模型,两种不通模型性能也不同,它们怎么处理数据的?
|
存储 Kubernetes 容器
在k8S中,CSI模型是什么?
在k8S中,CSI模型是什么?

推荐镜像

更多