官方博客-第4页-阿里云开发者社区

阿里云云原生

2025-04-29

680

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

本文介绍了阿里云Prometheus 2.0方案，针对大规模AI系统的可观测性挑战进行全面升级。内容涵盖数据采集、存储、计算、查询及生态整合等维度。 Prometheus 2.0引入自研LoongCollector实现多模态数据采集，采用全新时序存储引擎提升性能，并支持RecordingRule与ScheduleSQL预聚合计算。查询阶段提供跨区域、跨账号的统一查询能力，结合PromQL与SPL语言增强分析功能。此外，该方案已成功应用于阿里云内部AI系统，如百炼、通义千问等大模型全链路监控。未来，阿里云将发布云监控2.0产品，进一步完善智能观测技术栈。

阿里云云原生

680

张佐玮

2023-12-01

1546

Koordinator 助力云原生应用性能提升，小红书混部技术实践

本文基于 2023 云栖大会上关于 Koordinator 分享的实录，介绍小红书通过规模化落地混部技术来大幅提升集群资源效能，降低业务资源成本。

张佐玮

1,546

赫曦

2024-05-15

93192

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

本文主要介绍了通过弹性，实现成本优化，解决集群资源利用率难题。

赫曦

93,192

刘佳旭

2023-09-26

138996

云原生场景下高可用架构的最佳实践

刘佳旭

138,996

子白

2024-05-15

102450

大语言模型推理提速，TensorRT-LLM 高性能推理实践

大型语言模型（Large language models,LLM）是基于大量数据进行预训练的超大型深度学习模型，本文主要讲述TensorRT-LLM利用量化、In-Flight Batching、Attention、Graph Rewriting提升 LLM 模型推理效率。

子白

102,450

探索云世界

2024-05-15

1535

3步教你在云服务器上做Github DevOps部署

本文指导您使用阿里云DevOps工具云效，将Github中托管的代码部署在云服务器ECS中，使得用户能够在互联网公网中访问个人应用服务。文章来自云服务器ECS开发实践征文活动用户投稿，已获得作者（昵称秋天）授权发布。

探索云世界

1,535

信徒

2024-12-05

830

我的程序突然罢工了｜深入探究HSF调用异常，从死锁到活锁的全面分析与解决

本文详细记录了作者在处理HSF调用异常问题的过程中，从初步怀疑死锁到最终发现并解决活锁问题的全过程。

信徒

830

丕天

2025-03-21

1130

AI 推理场景的痛点和解决方案

一个典型的推理场景面临的问题可以概括为限流、负载均衡、异步化、数据管理、索引增强 5 个场景。通过云数据库 Tair 丰富的数据结构可以支撑这些场景，解决相关问题，本文我们会针对每个场景逐一说明。

丕天

1,130

阿里云云原生

2025-05-06

1309

MCP 规范新版本特性全景解析与落地实践

MCP Specification 在 2025-03-26 发布了最新的版本，本文对主要的改动进行详细介绍和解释

阿里云云原生

1,309

官方博客-第4页-阿里云开发者社区

类目筛选

内容类型

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

Koordinator 助力云原生应用性能提升，小红书混部技术实践

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

云原生场景下高可用架构的最佳实践

大语言模型推理提速，TensorRT-LLM 高性能推理实践

3步教你在云服务器上做Github DevOps部署

我的程序突然罢工了｜深入探究HSF调用异常，从死锁到活锁的全面分析与解决

AI 推理场景的痛点和解决方案

MCP 规范新版本特性全景解析与落地实践

官方博客-第4页-阿里云开发者社区

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

类目筛选

内容类型

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

Koordinator 助力云原生应用性能提升，小红书混部技术实践

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

云原生场景下高可用架构的最佳实践

大语言模型推理提速，TensorRT-LLM 高性能推理实践

3步教你在云服务器上做Github DevOps部署

我的程序突然罢工了｜深入探究HSF调用异常，从死锁到活锁的全面分析与解决

AI 推理场景的痛点和解决方案

MCP 规范新版本特性全景解析与落地实践