PAI-DLC 深度学习训练平台介绍|学习笔记

本文涉及的产品
模型训练 PAI-DLC,100CU*H 3个月
交互式建模 PAI-DSW,每月250计算时 3个月
模型在线服务 PAI-EAS,A10/V100等 500元 1个月
简介: 快速学习 PAI-DLC 深度学习训练平台介绍。

开发者学堂课程【PAL 平台学习路线:机器学习入门到应用:PAI-DLC 深度学习训练平台介绍】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/855/detail/14231


PAI-DLC 深度学习训练平台介绍

 

内容介绍:

一、集群

二、镜像

三、最佳实践

 

PAI-DLC 深度学习训练平台的核心能力并且演示快速提交单机学习任务的最佳时间。

 

一、集群

首先需要准备集群,PAI-DLC 支持公共资源组和转悠资源组工作集群。

登录 PAI-DLC 控制台进入深度学习训练模块,第一次使用需要角色授权创建公共资源组。公共资源组按照实际时长计费无需自行维护计算资源集群,只需要在创建训练任务的时候确定使用的资源类型。点击添加集群可创建专有资源组(不进行额外的计费,只需要支付底层 ACK 计算资源和相关网络组件的费用即可)。点击新建集群可跳转到 ACK 控制台创建新的集群;如果对如何创建 ACK 集群有疑问,参考文档创建 Kubernetes 专有版集群。

如果您使用的是专有资源组需要注意,需要有你的ACK集群开启公网服务。打开 ACK 集群控制台,选择集群,在集群资源模块选 择 LSD 的链接点击进入。需要在实例详情里去确认网络类型为共有网络。

可以为新建的集群开启公网 Ingress 服务,也可以为已有的 ACK 集群开启公网。具体参考文档。

 

二、镜像

在 PAI-DLC 中创建深度学习任务时,需要配置工作节点的镜像,PAI-DLC 系统支持公共镜像的自定义镜像。在AI资产管理进入镜像管理。

 

三、最佳实践

PAI-DLC 快速提交单机 Pytorch 迁移学习任务。

如下图,可里查看最佳实践的详细说明,最佳实践已经配备好的训练和代码。

图片4.png

点击集群控制台进入 DLC

图片3.png

点击新建任务填写任务名称

图片2.png

镜像配置支持公共镜像和自定义镜像。

公共镜像包含社区提供的标准镜像和 PAI-DLC 提供的多种镜像。

支持不同的资源类型。PYTHON 版本以及深度学习框架。镜像的详细说明可以参考文档公共镜像列表。

图片1.png

该实践选择 PAI 平台镜像,任务类型选择 PY-TORCH。在执行命令里面需要配置下载数据和代码的地址。执行训练的命令以及检查模型。

配置执行任务的节点数量以及资源,最后点击提交。任务创建完成后点击日志查看用户日志和实践。

相关实践学习
使用PAI+LLaMA Factory微调Qwen2-VL模型,搭建文旅领域知识问答机器人
使用PAI和LLaMA Factory框架,基于全参方法微调 Qwen2-VL模型,使其能够进行文旅领域知识问答,同时通过人工测试验证了微调的效果。
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
相关文章
|
7月前
|
机器学习/深度学习 人工智能 JSON
【解决方案】DistilQwen2.5-R1蒸馏小模型在PAI-ModelGallery的训练、评测、压缩及部署实践
阿里云的人工智能平台 PAI,作为一站式的机器学习和深度学习平台,对DistilQwen2.5-R1模型系列提供了全面的技术支持。无论是开发者还是企业客户,都可以通过 PAI-ModelGallery 轻松实现 Qwen2.5 系列模型的训练、评测、压缩和快速部署。本文详细介绍在 PAI 平台使用 DistilQwen2.5-R1 蒸馏模型的全链路最佳实践。
|
6月前
|
人工智能 JSON 算法
【解决方案】DistilQwen2.5-DS3-0324蒸馏小模型在PAI-ModelGallery的训练、评测、压缩及部署实践
DistilQwen 系列是阿里云人工智能平台 PAI 推出的蒸馏语言模型系列,包括 DistilQwen2、DistilQwen2.5、DistilQwen2.5-R1 等。本文详细介绍DistilQwen2.5-DS3-0324蒸馏小模型在PAI-ModelGallery的训练、评测、压缩及部署实践。
|
6月前
|
机器学习/深度学习 人工智能 供应链
从概念到商业价值:AI、机器学习与深度学习全景指南
在这个科技飞速发展的时代🚀,人工智能正以惊人的速度渗透到我们的生活和工作中👀。但面对铺天盖地的AI术语和概念,很多人感到困惑不已😣。"AI"、"机器学习"、"深度学习"和"神经网络"到底有什么区别?它们如何相互关联?如何利用这些技术提升工作效率和创造价值?
|
3月前
|
机器学习/深度学习 自然语言处理 算法
Java 大视界 -- Java 大数据机器学习模型在自然语言处理中的对抗训练与鲁棒性提升(205)
本文探讨Java大数据与机器学习在自然语言处理中的对抗训练与鲁棒性提升,分析对抗攻击原理,结合Java技术构建对抗样本、优化训练策略,并通过智能客服等案例展示实际应用效果。
|
10月前
|
人工智能 调度 芯片
PAI训练服务:云上大模型训练新篇章
本文介绍了通用AI时代下的新训练方法及PAI平台的优化。随着大模型时代的到来,算力需求激增,硬件和网络通信成为瓶颈。PAI平台通过自动容错、3D健康检测等技术确保训练稳定性;通过资源配额、智能调度等提高性价比;并推出PAI-TorchAcc和PAI-ChatLearn两大引擎,分别实现高效训练加速和灵活的对齐训练,显著提升训练性能与效果。这些改进解决了大规模AI训练中的关键问题,提升了效率和稳定性。
|
7月前
|
机器学习/深度学习 存储 Kubernetes
【重磅发布】AllData数据中台核心功能:机器学习算法平台
杭州奥零数据科技有限公司成立于2023年,专注于数据中台业务,维护开源项目AllData并提供商业版解决方案。AllData提供数据集成、存储、开发、治理及BI展示等一站式服务,支持AI大模型应用,助力企业高效利用数据价值。
|
8月前
|
人工智能 自然语言处理 算法
MT-MegatronLM:国产训练框架逆袭!三合一并行+FP8黑科技,大模型训练效率暴涨200%
MT-MegatronLM 是摩尔线程推出的面向全功能 GPU 的开源混合并行训练框架,支持多种模型架构和高效混合并行训练,显著提升 GPU 集群的算力利用率。
617 18
|
8月前
|
机器学习/深度学习 人工智能 边缘计算
DistilQwen2.5蒸馏小模型在PAI-ModelGallery的训练、评测、压缩及部署实践
DistilQwen2.5 是阿里云人工智能平台 PAI 推出的全新蒸馏大语言模型系列。通过黑盒化和白盒化蒸馏结合的自研蒸馏链路,DistilQwen2.5各个尺寸的模型在多个基准测试数据集上比原始 Qwen2.5 模型有明显效果提升。这一系列模型在移动设备、边缘计算等资源受限的环境中具有更高的性能,在较小参数规模下,显著降低了所需的计算资源和推理时长。阿里云的人工智能平台 PAI,作为一站式的机器学习和深度学习平台,对 DistilQwen2.5 模型系列提供了全面的技术支持。本文详细介绍在 PAI 平台使用 DistilQwen2.5 蒸馏小模型的全链路最佳实践。
|
8月前
PAI-Rec推荐平台对于实时特征有三个层次
PAI-Rec推荐平台针对实时特征有三个处理层次:1) 离线模拟反推历史请求时刻的实时特征;2) FeatureStore记录增量更新的实时特征,模型特征导出样本准确性达99%;3) 通过callback回调接口记录请求时刻的特征。各层次确保了实时特征的准确性和时效性。
208 0

热门文章

最新文章