使用云监控2.0页面诊断问题根因-延迟分析指南

简介: 针对一次故障的根因诊断,云监控2.0调用链分析发现异常耗时,经排查为【checkout】服务独占耗时过长,进一步分析确认其CPU使用率突增至100%,判定根因为【checkout.cpu】性能问题。

1. 输入数据

{"problem_id": "003", "time_range": "2025-08-29 10:14:20 ~ 2025-08-29 10:19:20", "candidate_root_causes": ["ad.Failure", "ad.LargeGc", "ad.memory", "ad.cpu","ad.networkLatency", "cart.Failure", "cart.cpu", "checkout.cpu", "checkout.Failure", "image-provider.cpu", "image-provider.memory", "image-provider.networkLatency", "inventory.Failure", "inventory.cpu", "inventory.memory", "inventory.networkLatency", "load-generator.cpu", "load-generator.FloodHomepage", "payment.Failure", "payment.Unreachable", "payment.cpu", "payment.memory", "payment.networkLatency", "product-catalog.Failure", "product-catalog.cpu", "product-catalog.memory", "product-catalog.networkLatency", "recommendation.CacheFailure", "recommendation.Failure", "recommendation.cpu", "recommendation.memory", "recommendation.networkLatency", "system.NodeKiller"], "alarm_rules": ["frontend_avg_rt"]}


2. 页面操作

2.1 查看错误数据

  1. 访问下面的链接进入云监控2.0调用链分析页面:
  1. 依次点击左栏应用监控、顶栏调用链分析;
  2. 将故障时段2025-08-29 10:14:20 ~ 2025-08-29 10:19:20原样复制,粘贴至页面右上角时间输入框,回车确认。在Span列表中,点击耗时排序箭头,在操作列点击详情按钮,查看耗时较长的 Span 信息:

根据文档说明,点击黑线最长的轨迹,可见自身耗时较长的调用段checkout SERVER,对应的主机名为checkout-5d79bbcb9-mvnkr

2.3 智能分析

在Trace详情页面,点击检测到异常右侧的魔棒按钮,可展开 Copilot 并向其提问:

2.4 定位性能问题

在左栏菜单点击容器洞察,悬停展开资源中心菜单,点击Pod列表:

在页面顶部点击+展开查询栏。展开 key 菜单,选定name;展开 value 菜单,选择前文出现异常的机器名checkout-5d79bbcb9-mvnkr,点击确认:

在Pod 名称列表中,悬停展开操作列表,点击眼球按钮,在弹出页面中点击打开实体:

在实体详情页面,CPU Resource栏目下点击CPU Usage图表中的同比环比按钮:

点击展开选单,选择1小时,点击查询:

对比 1 小时前的数据可发现:CPU 使用率从 24.889%显著上升至 99.287%,可视为异常。

3. 得出结论

结合调用链视图与 Copilot 分析结果,观察独占耗时高的调用段(Span)及其性能指标,可以定位故障根因系checkout出现 CPU 负载故障。

{"problem_id": "003", "root_causes": ["checkout.cpu"]}


相关文章
|
监控
使用云监控2.0页面诊断问题根因-错误分析指南
针对一次故障的根因诊断,通过云监控2.0调用链分析。
2687 0
|
机器学习/深度学习 存储 人工智能
|
机器学习/深度学习 监控 Web App开发
SLS机器学习最佳实战:根因分析(一)
通过算法,快速定位到某个宏观异常在微观粒度的具体表现形式,能够更好的帮助运营同学和运维同学分析大量异常,降低问题定位的时间。
13568 0
|
运维 Kubernetes 容器
使用SPL快速诊断问题根因 -- 延迟分析指南
查找故障时段内系统异常根因。
1035 0
|
2月前
|
人工智能 弹性计算 运维
2026年阿里云ECS、轻量、GPU云服务器、百炼大模型配置价格与活动权益详解
2026年阿里云持续加码普惠上云政策,针对个人开发者、学生群体、小微创业团队、中小企业推出覆盖基础算力与AI算力的双维度特惠活动,涵盖轻量应用服务器、ECS云服务器全系梯度机型,以及百炼大模型免费算力、包月订阅、组合购专属权益。本次年度活动最大亮点为长效价格保障、新手零门槛试用、AI与云算力组合优惠,同时延续续费同价核心政策,彻底解决传统上云续费溢价、算力成本不可控、新手试错成本高的行业痛点。整套活动规则清晰、机型梯度完善、算力权益分层,兼顾个人学习测试、轻量建站、小型业务部署、常态化AI研发等全场景需求,是本年度低成本搭建云端业务与AI智能化能力的最优方案。
282 2
|
7月前
|
人工智能 弹性计算 机器人
2026年阿里云SAE部署OpenClaw(Clawdbot)攻略 附快速部署步骤指南
在AI智能助理深度融入办公场景的2026年,OpenClaw(曾用名Clawdbot)凭借自主执行邮件管理、代码编写、日历调度等实际任务的能力,成为个人与企业打造专属AI助手的优选框架。阿里云Serverless应用引擎(SAE)为OpenClaw提供了一站式部署方案,依托Serverless架构的弹性伸缩、全托管免运维特性,完美适配OpenClaw的潮汐式工作负载,既保证功能完整执行,又能实现按实际使用量付费,大幅降低资源闲置成本。本文将基于阿里云官方部署指南,详细拆解SAE部署OpenClaw的全流程,包含可直接复制的代码命令、网络配置、模型对接及钉钉AI助理构建步骤,同时新增新手专属的阿
2160 1
|
运维 监控 存储
使用SPL快速诊断问题根因 -- 错误分析指南
本内容记录了一次故障排查过程
2335 0
|
存储 缓存 NoSQL
开源 | 阿里云 Tair KVCache Manager:企业级全局 KVCache 管理服务的架构设计与实现
阿里云 Tair 联合团队推出企业级全局 KVCache 管理服务 Tair KVCache Manager,通过中心化元数据管理与多后端存储池化,实现 KVCache 的跨实例共享与智能调度。该服务解耦算力与存储,支持弹性伸缩、多租户隔离及高可用保障,显著提升缓存命中率与资源利用率,重构大模型推理成本模型,支撑智能体时代的规模化推理需求。
|
11月前
|
Kubernetes Go 调度
Kubeflow-Trainer-架构学习指南
本指南系统解析Kubeflow Trainer架构,涵盖核心设计、目录结构与代码逻辑,结合学习路径与实战建议,助你掌握这一Kubernetes原生机器学习训练平台的原理与应用。
1084 139
|
机器学习/深度学习 人工智能 运维
运维告警别乱飞了!AI智能报警案例解析
运维告警别乱飞了!AI智能报警案例解析
1055 0

热门文章

最新文章