ACK 云原生 AI 套件概述 | 学习笔记

简介: 快速学习 ACK 云原生 AI 套件概述

开发者学堂课程【5分钟玩转阿里云容器服务ACK 云原生 AI 套件概述】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/1038/detail/18136


ACK 云原生 AI 套件概述

今天将向大家介绍什么是云原生 AI 以及云原生 AI 套件的核心场景与产品能力。

得益于深度学习等算法的突破,GPO 等算力性能提升,海量生产数据的积累,AI技术成熟度持续提高,产业化落地提速。然而算力成本高、生产效率低等挑战也日益凸显。云原生定义了云计算时代最大化利用云的能力,发挥云的价值的最佳路径。云原生架构和技术越来越多的被应用到企业生产环境中,助力企业数字化升级,加速业务提效创新。因此越来越多企业在 kubernetes 集群中管理异构资源开发运行、深度学习和大数据任务部署和弹性管理AI 服务,希望将人员生丰富的生产实践经验复制到 AI 和大数据领域。

阿里云容器服务 ACK 在 2021 年正式发布云原生 AI 套件。云原生 AI 套件是 ACK 对 AI 负载在基础服务层的增强,以 kubernetes 容器服务为底座向下封装对各类异构资源的统一管理,向上提供标准 kubernetes 集群环境和 API 提供了异构资源调度优化、AI任务调度与弹性伸缩、数据编排与访问加速 AI 作业生命周期管理等核心能力。

image.png

ACK 原生 AI 套件以组件化的方式提供服务,所有组件开箱即用,可灵活组装与扩展,并通过统一的命令行工具、多种语言 SDK 直接使用或定制开发,对 AI 大数据应用全栈优化性能、效率和成本,助力企业快速定制化构建符合自己需求的 AI 平台。ACK 原生 AI 套件还可以与阿里云机器学习平台派无缝的集成起来,为用户提供非常高效灵活的云原生 AI 平台。

一方面派平台的 dsw DLC ES 等服务介入 ACK ,为用户 AI 模型开发、训练和推理带来更好的弹性和效率。另一方面可以在 kubernetes 应用中灵活的集成派平台、深度优化的算法引擎和领域最佳实践,极大优化训练与推理效果,降低 AI 落地门槛。

image.png

ACK 云原生 AI 套件聚焦在两个核心场景,一是持续优化异构资源效率,对阿里云 S 或者客户 IDC 内各种异构资源进行抽象统一管理、运维和分配,通过弹性和软硬协同优化,持续提升资源利用率。二是高效运行 AI 大数据等异构负载,统一管理作业生命周期,统一调度任务工作流,保证任务规模和性能。

image.png

针对异构计算场景,云原生 AI 套件在 ACK 之上增加了对 GPU NPU 等异构算力、 RDMA 高性能网络等资源的支持。针对 GPO ,NPU 这类比较昂贵的资源,还提供了资源利用率优化。一是结合 ACK 弹性节点池,对 GPU 在资源节点数和运行任务实例数两层按需自动伸缩。

二是提供 GPU 共享调度,减少 GPU 卡资源空闲浪费。集成阿里云 cgpo 技术,避免共享 GPU 的多个容器之间出现资源抢占和错误影响。还提供 GPU 拓扑感知等增强调度、多维度 GPU 监控等。基于 ACK 云原生 AI 套件, AI 平台的开发运维人员可以高效率、低成本的管理异构基础设施,既能大幅提高资源利用率,又能显著降低运维复杂度。针对深度学习场景,云原生 AI 套件将 AI 生产过程的主要环节进行抽象,以命令行工具 arena 进行管理,屏蔽底层资源管理、调度分配和监控的复杂性。可支持 tensorflow PyTorch harvard 等深度学习 AI 任务 Spark Flink 等大数据任务 MPI 高性能计算作业等。

还可以结合 copy flow pipeline 或 Argo 开源云原生工作流引擎,为复杂的 AI 任务提供工作流编排服务。

对于 AI 分布式训练等场景, ACK 调度器支持多种典型批量调度策略,支持新的优先级任务队列和租户弹性资源配额控制。为避免过度的云资源消费,云原生 AI 套件还支持了弹性模型训练和弹性模型推理,针对存算分离架构带来的数据访问延迟和远程拉取数据带宽开销大的挑战。

云原生 AI 套件对计算任务使用数据的过程进行抽象,提出弹性数据集的概念,构建了数据编排与加速系统。 fluid 实现数据集管理和权限控制,承载阿里云金岛 FS 开源 align show jose FS 等缓存引擎,实现数据集的预热加速以及监控弹性等能力。

基于 ACK 原生 AI 套件,数据科学家和算法工程师可以低门槛提交 AI 任务,高效运行和弹性管理 AI 负载。目前 ACK 云原生 AI 套件正在公测阶段,适配公共云、专有云、混合云以及边缘等多环境交付,以获得互联网、在线教育、自动驾驶等行业客户的使用。

image.png

欢迎您免费开通原生 AI 套件进行体验。如果您希望第一时间获取原生 AI 套件的新功能发布和活动资讯或者有任何疑问,欢迎加入我们的钉钉交流群。对于更多全面详细的功能介绍和操作教程,我们将在后续的视频中逐步跟大家分享。

相关实践学习
深入解析Docker容器化技术
Docker是一个开源的应用容器引擎,让开发者可以打包他们的应用以及依赖包到一个可移植的容器中,然后发布到任何流行的Linux机器上,也可以实现虚拟化,容器是完全使用沙箱机制,相互之间不会有任何接口。Docker是世界领先的软件容器平台。开发人员利用Docker可以消除协作编码时“在我的机器上可正常工作”的问题。运维人员利用Docker可以在隔离容器中并行运行和管理应用,获得更好的计算密度。企业利用Docker可以构建敏捷的软件交付管道,以更快的速度、更高的安全性和可靠的信誉为Linux和Windows Server应用发布新功能。 在本套课程中,我们将全面的讲解Docker技术栈,从环境安装到容器、镜像操作以及生产环境如何部署开发的微服务应用。本课程由黑马程序员提供。     相关的阿里云产品:容器服务 ACK 容器服务 Kubernetes 版(简称 ACK)提供高性能可伸缩的容器应用管理能力,支持企业级容器化应用的全生命周期管理。整合阿里云虚拟化、存储、网络和安全能力,打造云端最佳容器化应用运行环境。 了解产品详情: https://www.aliyun.com/product/kubernetes
相关文章
|
8月前
|
消息中间件 人工智能 安全
云原生进化论:加速构建 AI 应用
本文将和大家分享过去一年在支持企业构建 AI 应用过程的一些实践和思考。
2021 74
|
人工智能 Cloud Native 安全
云原生+AI 为企业出海提供全新技术引擎!明天见
5月22日 14:00「飞天发布时刻」,阿里云云原生应用平台产品负责人李国强将重磅揭晓面向 AI 场景的云原生产品体系升级,通过弹性智能的全球一体化架构、开箱即用的云原生 AI 工程化能力,为中国企业出海提供全新技术引擎。
|
人工智能 运维 安全
AI 安全架构概述
AI 安全架构涵盖数据采集、模型训练、推理部署等阶段,确保安全性、隐私与合规。其核心组件包括数据层、模型层、推理层、应用层和运维层,针对数据安全威胁(如数据投毒)、模型窃取、对抗攻击及系统漏洞等风险,提出数据加密、对抗训练、联邦学习等防御策略,并强调开发前、开发中和部署后的最佳实践,以降低 AI 解决方案的安全风险。
1547 14
|
8月前
|
人工智能 Cloud Native 关系型数据库
云栖重磅|瑶池数据库:从云原生数据底座向“AI就绪”的多模态数据底座演进
瑶池数据库:从云原生数据底座向“AI就绪”的多模态数据底座演进
|
12月前
|
人工智能 移动开发 JavaScript
AI + 低代码技术揭秘(一):概述
VTJ.PRO 是一个基于 AI 的 Vue3 低代码开发平台,支持 Vue 单文件组件(SFC)与领域特定语言(DSL)之间的双向转换。它构建于 monorepo 架构之上,提供同步版本控制和全面的软件包生态系统,涵盖可视化设计、代码生成及多平台部署功能,同时兼容现有 Vue 3 工作流。平台特点包括双向代码流、AI 集成、Vue 3 基础支持、多平台适配以及低学习门槛等。通过模块化架构与智能工具,VTJ 加速开发流程并保持灵活性,适用于 Web、移动及跨平台项目。当前版本为 0.12.40,源码托管于 Gitee。
464 8
AI + 低代码技术揭秘(一):概述
|
11月前
|
数据采集 人工智能 Java
阿里云正式开源 LoongSuite:打造 AI 时代的高性能低成本可观测采集套件
AI Agent技术架构的演进正在重塑软件工程实践方式。开发者可通过智能编程助手提升效率,也可依托专业框架构建智能体系统。技术生态呈现多维度发展,涵盖高代码与低代码方案,并支持Java和Python等多语言。新型开发范式如AutoGen和LangChain降低了开发门槛。LoongSuite作为可观测采集套件,助力企业高效构建AI时代可观测体系,推动标准化数据规范,提升系统稳定性与运维效率。
|
人工智能 运维 Cloud Native
云原生 Meetup,AI 应用工程化专场·广州站
欢迎莅临广州市海珠区鼎新路 88 号广州阿里中心,O-N-10-02 春秋书院。报名成功后,您将在活动前一周收到短信通知。
279 101
|
存储 人工智能 Cloud Native
【发布实录】云原生+AI,助力企业全球化业务创新
本文介绍了阿里云在云原生与AI结合领域的最新产品发布和技术创新。首先,通过弹性智能的一体化架构,阿里云为AI场景提供了开箱即用的云原生能力,助力企业出海。其次,详细解析了云原生如何助力AI应用构建,包括Function AI平台、GPU极速模式、MCP Server开发托管及AI网关等核心功能。
|
Cloud Native Serverless 数据中心
阿里云ACK One:注册集群支持ACS算力——云原生时代的计算新引擎
ACK One注册集群已正式支持ACS(容器计算服务)算力,为企业的容器化工作负载提供更多选择和更强大的计算能力。

推荐镜像

更多