Prometheus

首页 标签 Prometheus
# Prometheus #
关注
2551内容
|
6小时前
| |
来自: 云原生
AI Agent 时代,需要的不是更多数据,而是一个语义层
AI Agent 缺的不是数据而是系统地图。UnifiedModel 开源语义层将资产、数据与关系组织为可查询对象图,实验显示旗舰模型准确率提升 10-20%。它助 Agent 按对象读数、沿关系定位根因,真正看懂复杂系统。
|
13天前
| |
来自: 数据库
Redis 监控面板搭建:Tair 企业版全链路可观测方案
本文详细拆解如何用 Tair 控制台 + 云监控在 30 分钟内搭建一套生产级 Redis 监控面板。
|
18天前
| |
来自: 数据库
《电商API调用链路追踪:九家平台耗时/成功率/成本的可观测性方案》(附Python源码)
本方案为九家电商API打造统一可观测性体系:融合RED(耗时/错误率/QPS)、USE(配额/余额/超量)、FinOps(调用/云资源/敞口)三层指标,覆盖平台/店铺/API三维度,输出实时看板、日报与多通道告警;基于OpenTelemetry+自研Exporter归一化“API方言”,实测故障定位从45分钟缩至3分钟,成本异常由月底延迟转为实时感知。(239字)
|
28天前
| |
来自: 云原生
从“自己造轮子”到“OpenAPI 嵌进来”:精臣全栈上云后的智能运维底座之选
精臣业务全球化发展导致系统复杂度激增,面临业务系统拓扑复杂、问题根因定位链路较长等挑战。借助阿里云 STAROps 构建全域智能运维体系,实时生成业务系统全域拓扑图,实现自建 SRE 平台闭环诊断,推动运维向 AI 智能化转型。
|
30天前
|
[058][调度模块]任务生命周期事件与监听器机制
本文介绍调度模块的任务生命周期事件机制,通过`ChangeStatusEvent`事件与`ChangeStatusEventConsumer`监听器,实现任务状态(CREATED/STARTED/COMPLETED等)变更的灵活监听。支持日志、持久化、消息推送等扩展,具备高解耦性与异常隔离能力。(239字)
|
2月前
| |
来自: 数据库
第三方 API 接口后的架构反思:适配器模式 + 重试 + 熔断的通用封装
本文总结了对接50+第三方API的实战经验,提出「适配器+管道+策略」架构:通过统一请求/响应模型、SPI接口契约、鉴权/重试/熔断管道及可观测性埋点,实现高复用、易扩展、强容错。完整代码开箱即用。(239字)
|
2月前
| |
来自: 云原生
ARMS + SLS 实战:从黑盒到全链路可观测的微服务监控体系搭建
线上故障平均定位时间 2 小时,P0 故障从发生到发现要 30 分钟——这是多数微服务团队的真实困境。我们在 12 个微服务、日均请求 5000 万+的电商系统中,基于阿里云 ARMS + SLS + Prometheus 搭建全链路可观测体系后,故障发现缩短到 30 秒,定位时间降到 5 分钟。本文从可观测性痛点出发,详解 ARMS APM 无侵入接入、SLS 日志体系建设、Prometheus 指标与 Grafana 看板、告警体系设计,以及 5 个生产踩坑实录和可观测性成熟度模型。
|
2月前
|
大模型API调用成本控制:Token估算、缓存策略与模型选择实践
本文介绍面向高频查询(日数百次)的大模型成本控制方案,涵盖Token估算、Redis缓存、多模型分级选型(Turbo/Plus/Max)及Prometheus费用监控告警。基于阿里云百炼与DashScope实现,需Python基础及API Key
免费试用