首个云上 AI 原生全栈可观测平台来了!

本文涉及的产品
服务治理 MSE Sentinel/OpenSergo,Agent数量 不受限
Serverless 应用引擎免费试用套餐包,4320000 CU,有效期3个月
性能测试 PTS,5000VUM额度
简介: 9月21日,2024 云栖大会,阿里云发布全新的 AI 原生全栈可观测平台,首次实现云上 AI 大模型从训练到推理再到应用的全链路实时观测、告警与诊断。

9月21日,2024云栖大会,阿里云发布全新的 AI 原生全栈可观测平台,首次实现云上 AI 大模型从训练到推理再到应用的全链路实时观测、告警与诊断。


阿里云可观测产品家族实现全新升级,最常用的日志服务 SLS 相较于自建体系,运维监控综合成本可降低 30%。


AI 模型的深入发展,导致了数据处理方式与技术架构的深刻变化,相关应用产生的日志、链路等可观测数据规模呈指数级增长,数据结构复杂度也与日俱增,而 AI 部署的异构环境、资源及平台也越发多元,都给可观测性的准确、实时、高效与智能化发展带来了巨大挑战。

image.png

阿里云云原生应用平台负责人丁宇表示,“以阿里云可观测产品家族为代表的云原生可观测工具,正引领着 AI-native 可观测加速迈向智能化。企业用户可以像‘搭积木’一样轻松、灵活地构建可观测体系,更高效地管理与观测 IT 资源与服务,为 AI 创新夯实技术底座。”


今天,阿里云宣布日志服务 SLS、云监控 CMS、应用实时监控服务 ARMS 等可观测产品家族重磅更新,面向模型训练、推理及应用提供全链路的可观测服务。

image.png

在模型训练场景中,云监控 CMS 与阿里云 AI 算力产品及平台深度集成,全面采集计算、存储、网络调度等 AI 基础设施的可观测数据,有效覆盖数据准备、模型开发、训练和部署等环节,确保模型训练全流程可感知、可观测,为企业在 AI 基础设施的容量管理和可用性保障保驾护航。


在模型推理场景中,可观测性更多聚焦于推理性能提升、模型输入输出的质量优化及资源消耗的有效管理。应用实时监控服务 ARMS 推出符合 OpenTelemetry 标准的自研 Python Agent,全面支持通义千问/ LLamaIndex / LangChain 等国内外主流框架和模型,采集丰富的指标、链路及持续剖析数据,借助开箱即用的数据可视化大盘与性能诊断功能,确保用户实时掌握模型运行状态及潜在瓶颈,为大模型应用的稳定运行与高效运维提供坚实的基础。


与此同时,日志服务 SLS 与大模型服务平台百炼深度集成,实现百炼模型 API 层面的可观测指标全覆盖,并应用于性能观测、稳定性评估、成本管控、安全合规等不同应用场景,帮助企业优化资源配置和业务决策。同时,SLS 核心能力大幅提升,扫描性能提升 10 倍,达到 1GB/s 以上;处理性能提升至 TB 级每分钟,单 GB 处理成本降低60%。此外,SLS 推出 Elasticsearch 兼容方案,相较于自建其综合成本可降30% 以上。


据悉,阿里云已为全球 80 余个国家的百万企业级用户提供高效便捷、安全稳定的可观测服务。


  • 茶百道基于 ARMS 快速建立运维观测与响应能力,故障恢复效率提升 50% 以上;
  • 传音借助 Prometheus、Grafana 等可观测产品,业务上线效率提高 60%;
  • 极氪基于阿里云可观测产品推行的应急响应机制与 ChatOps 协同机制,告警平均恢复耗时缩短 50%。

image.png

image.png

image.png

image.png

image.png

云栖大会剪影

相关实践学习
日志服务之使用Nginx模式采集日志
本文介绍如何通过日志服务控制台创建Nginx模式的Logtail配置快速采集Nginx日志并进行多维度分析。
目录
打赏
0
12
18
45
13400
分享
相关文章
从大规模恶意攻击 DeepSeek 事件看 AI 创新隐忧:安全可观测体系建设刻不容缓
唯有通过全行业的协同努力,加强整体、完善的网络安全可观测建设,才能为 AI 技术的创新和发展构建一个安全而稳固的环境。我们期盼并相信,在攻克这些网络安全难题之后,AI 创新将迎来更加安全、灿烂的未来。
9.9K star!大模型原生即时通信机器人平台,这个开源项目让AI对话更智能!
"😎高稳定、🧩支持插件、🦄多模态 - 大模型原生即时通信机器人平台"
RuoYi AI:1人搞定AI中台!开源全栈式AI开发平台,快速集成大模型+RAG+支付等模块
RuoYi AI 是一个全栈式 AI 开发平台,支持本地 RAG 方案,集成多种大语言模型和多媒体功能,适合企业和个人开发者快速搭建个性化 AI 应用。
128 21
RuoYi AI:1人搞定AI中台!开源全栈式AI开发平台,快速集成大模型+RAG+支付等模块
Bolt.diy:更灵活更开放的AI全栈开发工具
Bolt.new是一款爆火的AI全栈开发工具,允许用户在浏览器中运行Node.js环境并通过自然语言生成、编辑和部署Web应用。然而,它存在一定的封闭性,仅支持官方指定的大语言模型和Netlify部署。而Bolt.diy作为其开源版本,功能更强大灵活,支持多种大模型选择(如OpenAI、Anthropic等)、丰富的输入方式及多云部署选项(如Vercel、AWS)。此外,Bolt.diy还提供本地文件同步、代码下载到GitHub等功能,适用于快速原型设计、教育与企业级开发等多种场景。
Bolt.diy:更灵活更开放的AI全栈开发工具
通义灵码 AI 程序员-全平台AI程序员插件
人工智能正在深度融入开发流程,阿里云通义灵码AI程序员全面上线,支持VS Code与JetBrains IDEs,是国内首个真正落地的AI程序员工具。它不仅能生成代码、续写功能,还支持跨语言编程和图片生成代码。相较1.0版本,新增多项功能,模型更丰富,生成速度更快。快来体验未来开发的魅力!链接附上,欢迎探索。
68 7
从大规模恶意攻击 DeepSeek 事件看 AI 创新隐忧:安全可观测体系建设刻不容缓
从大规模恶意攻击 DeepSeek 事件看 AI 创新隐忧:安全可观测体系建设刻不容缓
【最佳实践系列】AI程序员让我变成全栈:基于阿里云百炼DeepSeek的跨语言公告系统实战
本文介绍了如何在Java开发中通过跨语言编程,利用阿里云百炼服务平台的DeepSeek大模型生成公告内容,并将其嵌入前端页面。
人人都是应用开发者:AI时代的全栈产品经理实践
本文试图最短路径、最轻模式来做一个应用,实现一个需求!仅需三大步+9小步,以下为手把手教学流程。
148 10
2025保姆级JupyterLab 4.0安装指南|全平台部署+AI编程环境配置
JupyterLab 是下一代交互式计算开发环境,2025年发布的4.0版本新增多语言内核支持(Python/R/Julia/JavaScript一键切换)、实时协作功能、AI辅助编程(集成GPT-5代码补全与错误诊断)和可视化调试器等特性。本文详细介绍其技术定位、跨平台安装方案、安装流程、高阶功能配置、典型应用场景及故障排查指南,帮助用户高效使用JupyterLab进行开发。
通义灵码 AI 程序员与开发者结伴编程,全栈开发电商工程的前后端功能需求
当你又收到了项目新需求的时候,可以尝试下载并使用通义灵码,让通义灵码 AI 程序员跟你一起结伴编程,它具备多文件代码修改和工具使用的能力,可以与你结伴协同完成编码任务,如需求实现、缺陷修复、单元测试生成、批量代码修改等,成为你的左膀右臂。下面我们就跟AI程序员结伴编程完成前后端需求的开发吧!
86 0