官方博客-第14页-阿里云开发者社区

阿里云云原生

2025-04-29

680

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

本文介绍了阿里云Prometheus 2.0方案，针对大规模AI系统的可观测性挑战进行全面升级。内容涵盖数据采集、存储、计算、查询及生态整合等维度。 Prometheus 2.0引入自研LoongCollector实现多模态数据采集，采用全新时序存储引擎提升性能，并支持RecordingRule与ScheduleSQL预聚合计算。查询阶段提供跨区域、跨账号的统一查询能力，结合PromQL与SPL语言增强分析功能。此外，该方案已成功应用于阿里云内部AI系统，如百炼、通义千问等大模型全链路监控。未来，阿里云将发布云监控2.0产品，进一步完善智能观测技术栈。

阿里云云原生

680

阿里云云原生

761

警惕日志采集失败的 6 大经典雷区：从本地管理反模式到 LoongCollector 标准实践

本文探讨了日志管理中的常见反模式及其潜在问题，强调科学的日志管理策略对系统可观测性的重要性。文中分析了6种反模式：copy truncate轮转导致的日志丢失或重复、NAS/OSS存储引发的采集不一致、多进程写入造成的日志混乱、创建文件空洞释放空间的风险、频繁覆盖写带来的数据完整性问题，以及使用vim编辑日志文件导致的重复采集。针对这些问题，文章提供了最佳实践建议，如使用create模式轮转日志、本地磁盘存储、单线程追加写入等方法，以降低日志采集风险，提升系统可靠性。最后总结指出，遵循这些实践可显著提高故障排查效率和系统性能。

阿里云云原生

761

张佐玮

2023-12-01

1546

Koordinator 助力云原生应用性能提升，小红书混部技术实践

本文基于 2023 云栖大会上关于 Koordinator 分享的实录，介绍小红书通过规模化落地混部技术来大幅提升集群资源效能，降低业务资源成本。

张佐玮

1,546

赫曦

2024-05-15

93192

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

本文主要介绍了通过弹性，实现成本优化，解决集群资源利用率难题。

赫曦

93,192

ModelScope

2024-05-15

1155

vLLM部署Yuan2.0：高吞吐、更便捷

vLLM是UC Berkeley开源的大语言模型高速推理框架，其内存管理核心——PagedAttention、内置的加速算法如Continues Batching等，一方面可以提升Yuan2.0模型推理部署时的内存使用效率，另一方面可以大幅提升在实时应用场景下Yuan2.0的吞吐量。

ModelScope

1,155

古琦

2024-07-04

109501

全链路追踪 & 性能监控，GO 应用可观测全面升级

当前，大多数面向 Golang 应用的监控能力主要是通过 SDK 方式接入，需要开放人员手动进行埋点，会存在一定问题。对此，可观测 Go Agent 应运而生。本文介绍的阿里云可观测 Go Agent 方案，能通过无侵入的方式实现应用监控能力。

古琦

109,501

阿里云云原生

2025-01-24

797

智能理解 PPT 内容，快速生成讲解视频

本方案利用函数计算 FC 部署 Web 应用，调用百炼模型服务实现 PPT 到视频的自动转换。视觉模型智能理解 PPT 图文内容，快速生成相匹配的解说词；文本模型对解说词进行优化，提高其可读性和吸引力；语音模型则根据解说词生成生动流畅的旁白音频。整个过程高度集成，只需一键操作，系统即可自动整合图片、文本和音频素材，快速生成对应讲解视频。

阿里云云原生

797

ModelScope

2025-06-16

544

告别‘人海战术’！基于EvalScope 的文生图模型智能评测新方案

生成式模型在文本生成图片等领域的快速发展，为社区带来了日新月异的诸多文生图模型。

ModelScope

544

子白

2024-05-15

102450

大语言模型推理提速，TensorRT-LLM 高性能推理实践

大型语言模型（Large language models,LLM）是基于大量数据进行预训练的超大型深度学习模型，本文主要讲述TensorRT-LLM利用量化、In-Flight Batching、Attention、Graph Rewriting提升 LLM 模型推理效率。

子白

102,450

官方博客-第14页-阿里云开发者社区

类目筛选

内容类型

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

警惕日志采集失败的 6 大经典雷区：从本地管理反模式到 LoongCollector 标准实践

Koordinator 助力云原生应用性能提升，小红书混部技术实践

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

vLLM部署Yuan2.0：高吞吐、更便捷

全链路追踪 & 性能监控，GO 应用可观测全面升级

智能理解 PPT 内容，快速生成讲解视频

告别‘人海战术’！基于EvalScope 的文生图模型智能评测新方案

大语言模型推理提速，TensorRT-LLM 高性能推理实践

官方博客-第14页-阿里云开发者社区

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

类目筛选

内容类型

剑指大规模 AI 可观测，阿里云 Prometheus 2.0 应运而生

警惕日志采集失败的 6 大经典雷区：从本地管理反模式到 LoongCollector 标准实践

Koordinator 助力云原生应用性能提升，小红书混部技术实践

阿里云云原生弹性方案，用弹性解决集群资源利用率难题

vLLM部署Yuan2.0：高吞吐、更便捷

全链路追踪 & 性能监控，GO 应用可观测全面升级

智能理解 PPT 内容，快速生成讲解视频

告别‘人海战术’！基于EvalScope 的文生图模型智能评测新方案

大语言模型推理提速，TensorRT-LLM 高性能推理实践