新场景、新能力,AI-native 时代的可观测革新

本文涉及的产品
Serverless 应用引擎 SAE,800核*时 1600GiB*时
服务治理 MSE Sentinel/OpenSergo,Agent数量 不受限
注册配置 MSE Nacos/ZooKeeper,118元/月
简介: 借助 AI-native 可观测解决方案,阿里云为用户提供开箱即用的覆盖大模型应用、大模型到基础设施的全链路实时观测、告警与诊断能力,帮助企业在复杂的数字化转型过程中更有效地确保资源的高效利用与业务的持续成功。

随着生成式 AI 概念爆火, AI-native 应用成为企业在 AI 时代的重点发力方向。新技术、新数据类型、新工作流所产生的复杂应用链路拓扑、组件依赖、大模型领域洞察催生出多元且复杂的运维需求,这都需要通过可观测性来保障服务 SLA 以及终端用户使用体验。


因此,面向 AI-native 应用技术栈的可观测能力解决方案成为日益重要的话题。本次云栖大会,阿里云正式发布 AI-native 全栈可观测平台,旨在帮助企业高效、低成本构建面向 AI-native 的可观测体系。

image.png

针对 AI infra ,阿里云通过软硬件一体化设计的算力集群服务“灵骏”对外提供高性能计算节点,灵骏以磐久服务器、高性能 RDMA 网络两部分组成,灵骏集群以分组-计算节点方式进行交付。借助 AI-native 全栈可观测平台,实现节点计算资源 GPU、RDMA、Nimitz 等组件监控数据以 Pushgateway 协议上报至 Prometheus,采集并观测 IaaS 层 CPU、内存、硬盘、网络及算力等各方面 1000+ 指标,实现集群级、节点级 GPU、RDMA 等资源的可观测能力。

image.png

为了进一步提升企业对于异构资源的调度能力,阿里云提供 ACK 灵骏托管集群与 AI 套件,向下封装对各类异构资源进行统一管理,向上提供标准 K8s 集群环境,提供高效、灵活的一站式 AI 平台。ACK 灵骏集群内置 Prometheus,一键采集整个 K8s 集群全部资源、组件的可观测数据。节点上安装阿里云增强的 GPU-Exporter 将 DCGM 服务以指标形式暴露出来,并通过集群-节点-Pod 维度展现 GPU 资源情况。同时,AI 套件通过 GPU 共享调度和 GPU 拓扑感知调度,实现高效管理 GPU 程序及 GPU 隔离,其 GPU 监控 2.0 基于 NVIDIA DCGM 构建。借助以上二者,帮助企业更直观地观测与管理异构算力资源。


为了能够让企业更高效、便捷地构建机器学习平台,阿里云提供 PaaS 层产品人工智能平台 PAI ,实现从数据准备、模型开发与训练及模型部署全阶段、全流程的覆盖。AI-native 全栈可观测平台为 PAI 产品提供全栈可观测能力,支持 EAS 在线推理指标,DLC 训练作业级、节点级、LRN 级资源指标透出,容器组件、节点、Pod 等集群相关资源指标,底层基础设施算力节点的可观测数据全采集、存储,并提供开箱即用的完整可观测大盘。

image.png

MaaS(Model as a Service)作为 AI-native 新生的服务理念,企业毋需关心模型训练、部署、维护等复杂过程,只需调用 API 并传入适当输入数据,就可以获得模型预测或分析结果,降低企业和个人应用 AI 技术的门槛。阿里云借助大模型服务平台百炼,通过标准化 API 提供模型推理、模型微调训练等多种模型服务。百炼将各种大模型、业务网关可观测数据写入 AI-native 全栈可观测平台,Prometheus 通过流式 ETL 工具实时将日志数据转换成指标数据分发到各租户名下,形成百炼模型 API 层面的可观测指标全覆盖。采集到的可观测数据被应用于性能观测(延迟/吞吐/资源利用)、稳定性评估(数据质量/漂移/异常洞察)、成本管控(Tokens/计算资源)、安全合规(隐私/合规)等不同应用场景。

image.png

相较于 Cloud-native 应用,AI-native 应用致力于追求更佳的模型效率与效果。因此,AI-native 应用可观测聚焦于推理性能的提升,模型输入输出的质量优化及资源消耗的有效管理。AI-native 应用的可观测性需要处理更高维度的数据,尤其涉及自然语言处理的复杂度,需要对模型输出进行语义分析。要实现上述 LLM Trace 语义的数据采集与上报,需具备端侧埋点自动采集以及对接服务端上报数据的能力。


为了更好观测以 Python 作为开发语言的 AI-native 应用,阿里云全新推出基于 OpenTelemetry Python Agent 底座的自研 Python Agent,支持 LLamaIndex/LangChain/通义千问/OpenAI 等国内外主流框架和模型,并支持最新 OpenTelemetry LLM semantic convention,实现精细化埋点的同时,支持自定义属性透传能力,从而提供更丰富的指标、链路及持续剖析数据,灵活的采样策略,细粒度管控,支持动态配置,提供多种性能诊断和数据可视化大盘,显著降低可观测性门槛,为 AI-native 应用的稳定运行与高效运维提供坚实的基础。

image.png

借助 AI-native 可观测解决方案,阿里云为用户提供开箱即用的覆盖大模型应用、大模型到基础设施的全链路实时观测、告警与诊断能力,帮助企业在复杂的数字化转型过程中更有效地确保资源的高效利用与业务的持续成功。

相关实践学习
通过云拨测对指定服务器进行Ping/DNS监测
本实验将通过云拨测对指定服务器进行Ping/DNS监测,评估网站服务质量和用户体验。
相关文章
|
8天前
|
弹性计算 人工智能 架构师
阿里云携手Altair共拓云上工业仿真新机遇
2024年9月12日,「2024 Altair 技术大会杭州站」成功召开,阿里云弹性计算产品运营与生态负责人何川,与Altair中国技术总监赵阳在会上联合发布了最新的“云上CAE一体机”。
阿里云携手Altair共拓云上工业仿真新机遇
|
4天前
|
机器学习/深度学习 算法 大数据
【BetterBench博士】2024 “华为杯”第二十一届中国研究生数学建模竞赛 选题分析
2024“华为杯”数学建模竞赛,对ABCDEF每个题进行详细的分析,涵盖风电场功率优化、WLAN网络吞吐量、磁性元件损耗建模、地理环境问题、高速公路应急车道启用和X射线脉冲星建模等多领域问题,解析了问题类型、专业和技能的需要。
2463 14
【BetterBench博士】2024 “华为杯”第二十一届中国研究生数学建模竞赛 选题分析
|
4天前
|
机器学习/深度学习 算法 数据可视化
【BetterBench博士】2024年中国研究生数学建模竞赛 C题:数据驱动下磁性元件的磁芯损耗建模 问题分析、数学模型、python 代码
2024年中国研究生数学建模竞赛C题聚焦磁性元件磁芯损耗建模。题目背景介绍了电能变换技术的发展与应用,强调磁性元件在功率变换器中的重要性。磁芯损耗受多种因素影响,现有模型难以精确预测。题目要求通过数据分析建立高精度磁芯损耗模型。具体任务包括励磁波形分类、修正斯坦麦茨方程、分析影响因素、构建预测模型及优化设计条件。涉及数据预处理、特征提取、机器学习及优化算法等技术。适合电气、材料、计算机等多个专业学生参与。
1502 14
【BetterBench博士】2024年中国研究生数学建模竞赛 C题:数据驱动下磁性元件的磁芯损耗建模 问题分析、数学模型、python 代码
|
1月前
|
运维 Cloud Native Devops
一线实战:运维人少,我们从 0 到 1 实践 DevOps 和云原生
上海经证科技有限公司为有效推进软件项目管理和开发工作,选择了阿里云云效作为 DevOps 解决方案。通过云效,实现了从 0 开始,到现在近百个微服务、数百条流水线与应用交付的全面覆盖,有效支撑了敏捷开发流程。
19274 29
|
1月前
|
人工智能 自然语言处理 搜索推荐
阿里云Elasticsearch AI搜索实践
本文介绍了阿里云 Elasticsearch 在AI 搜索方面的技术实践与探索。
18822 20
|
1月前
|
Rust Apache 对象存储
Apache Paimon V0.9最新进展
Apache Paimon V0.9 版本即将发布,此版本带来了多项新特性并解决了关键挑战。Paimon自2022年从Flink社区诞生以来迅速成长,已成为Apache顶级项目,并广泛应用于阿里集团内外的多家企业。
17515 13
Apache Paimon V0.9最新进展
|
6天前
|
编解码 JSON 自然语言处理
通义千问重磅开源Qwen2.5,性能超越Llama
击败Meta,阿里Qwen2.5再登全球开源大模型王座
365 11
|
1月前
|
存储 人工智能 前端开发
AI 网关零代码解决 AI 幻觉问题
本文主要介绍了 AI Agent 的背景,概念,探讨了 AI Agent 网关插件的使用方法,效果以及实现原理。
18697 16
|
2天前
|
算法 Java
JAVA并发编程系列(8)CountDownLatch核心原理
面试中的编程题目“模拟拼团”,我们通过使用CountDownLatch来实现多线程条件下的拼团逻辑。此外,深入解析了CountDownLatch的核心原理及其内部实现机制,特别是`await()`方法的具体工作流程。通过详细分析源码与内部结构,帮助读者更好地理解并发编程的关键概念。
|
2天前
|
SQL 监控 druid
Druid连接池学习
Druid学习笔记,使用Druid进行密码加密。参考文档:https://github.com/alibaba/druid
195 82