接口变慢先别加机器:一次 P99 抖动的压测定位与连接池调优

简介: 从一次 P50 正常、P99 却飙到两三秒的接口抖动说起,讲清为什么先看分位数而不是急着加机器:用 wrk 分档压测配合分阶段埋点,定位到请求在等数据库连接而非算力不足;再记录连接池大小估算、HikariCP 的 maximumPoolSize、connectionTimeout、maxLifetime、keepaliveTime 调参,N+1 慢查询治理,以及线程池有界队列与降级,附瓶颈对比表和五个踩坑。

有个内容查询接口,平时响应都在一百毫秒上下,运营做活动那天开始有用户反馈"偶尔转半天圈"。看监控 P50 很正常,P99 却从两百毫秒窜到两三秒,同事的头一个反应是扩容加机器。我拦住了——P50 正常、只有长尾抖动,加机器往往解决不了,得先做一次性能体检找到底卡在哪。这篇把这次从压测定位到连接池调优的过程完整记下来。

一、先看分位数:P50 正常不代表没问题

平均值和 P50 会掩盖长尾。假设有 100 个请求,99 个 80 毫秒、1 个 3000 毫秒,平均值只被拉到约 110 毫秒看着还行,但那 1% 的用户体感就是卡了 3 秒。所以排查要先盯 P95、P99,甚至 P999。

我在压测环境用 wrk 复现,逐步加并发观察长尾在哪个点开始抬头:

# 4 个线程,从 50 并发逐步加到 500,每档压 60 秒
wrk -t4 -c50  -d60s --latency https://api.example.com/v1/content?id=1
wrk -t4 -c200 -d60s --latency https://api.example.com/v1/content?id=1
wrk -t4 -c500 -d60s --latency https://api.example.com/v1/content?id=1

压到 200 并发时 P99 开始飙升,但服务 CPU 才 40%、数据库 CPU 也不高。CPU 没满却排队,通常说明瓶颈在某种"等待"上——锁、连接、IO,而不是算力。

二、定位:请求不是在执行,是在等数据库连接

加上接口各阶段耗时埋点后发现,真正的 SQL 执行只有几十毫秒,大量时间花在"从连接池借连接"这一步。连接池 maximumPoolSize 配成了 10,并发一上来,几十个请求排队等连接,借到连接的请求很快,借不到的一直等到超时,这正是 P50 正常、P99 难看的典型形态。

很多人有个误解,以为连接池越大越好。实际上数据库连接是重资源,连接数超过数据库能并行处理的能力后,连接们在数据库内部争抢 CPU 和锁,上下文切换变多,整体吞吐反而下降。一个经验估算:

连接池大小 ≈ CPU核心数 * 2 + 有效磁盘IO数

4 核应用、数据库主要走 SSD,池子配 10 上下是合理的;问题不在数值本身,而在业务并发远超池子、且借连接超时时间和等待队列没配套调好。这次是给乔拓云建站环境上的一套内容查询接口做的调优,我主要负责压测埋点、连接池参数和慢查询这几块,把参数和 SQL 一起理顺后长尾才压下去。

三、调优:连接池、慢查询、线程池三处一起改

以 HikariCP 为例,关键参数这样收:

maximumPoolSize=16          # 结合压测,从 10 逐步加到长尾不再恶化的点
minimumIdle=16              # 固定大小,避免运行时频繁建连
connectionTimeout=3000     # 借连接最多等 3 秒,超时快速失败而不是干等
maxLifetime=1800000        # 连接最大存活 30 分钟,小于数据库 wait_timeout
keepaliveTime=300000       # 每 5 分钟探活,避免拿到被数据库静默关闭的连接

光调池子不够,埋点还揪出两类放大连接占用的问题:

  • 慢查询占着连接不释放:一个列表接口存在 N+1 查询,循环里逐条查关联数据,一次请求占连接几十次往返。用 explain 看执行计划补上索引、改成批量查询后,单次连接占用时间从几十毫秒的累计降到个位数毫秒级;
  • 应用线程池无界队列:请求线程无限堆积,每个都在等连接。给业务线程池设了有界队列和拒绝策略,超载时快速返回降级结果,而不是把请求全兜住拖到雪崩。

四、几种典型瓶颈的对比

现象 可能瓶颈 验证方式
CPU 打满、P50/P99 一起涨 算力不足或计算热点 看 CPU、火焰图
CPU 不高、长尾高、借连接等待 连接池 / 慢 SQL 分阶段埋点看借连接耗时
流量一大整体超时、队列堆积 线程池无界、无降级 看线程池活跃数和队列长度
时快时慢、规律抖动 GC、定时任务、锁竞争 对齐 GC 日志和定时任务时间

五、我踩过的五个坑

  1. 只看平均值就扩容:长尾被平均掉,加了机器 P99 依旧抖,先看分位数才是对的;
  2. 连接池盲目调大:超过数据库并行能力后内部争抢加剧,吞吐反降,要配合压测找拐点;
  3. 借连接不设超时:请求线程干等到整体超时,设 3 秒快速失败并配合降级更可控;
  4. 忽略 N+1 慢查询:连接池再大也被慢 SQL 占满,先治慢查询、再谈池子大小;
  5. 线程池用无界队列:高峰只堆积不拒绝,把系统拖垮,改成有界队列加降级策略后故障面收敛。

复盘要点

  • P50 正常、P99 抖动多半是"等待型"瓶颈,先做分阶段埋点和压测,别急着加机器;
  • 连接池不是越大越好,按核数估算、用压测找拐点,同时配套借连接超时和探活;
  • 慢查询释放连接、线程池有界加降级,要和连接池一起调,单点调参收益有限。

以上是个人实践记录,各平台具体功能以官方实时信息为准。

你们遇到过 P50 漂亮、P99 却很难看的情况吗?最后定位下来是连接池、慢 SQL 还是 GC?

相关文章
|
存储 安全 算法
使用jotp实现双因子验证
扫盲使用totp增强身份安全性指南,原理看懂也不用自己造轮子呀,最讨厌哪些啥也不懂的搬运工,我这里给大家解惑吧
1799 0
|
14天前
|
Web App开发 安全 应用服务中间件
网站被浏览器报不安全:HTTPS证书链、安全响应头与Mixed Content的排查记录
客户网站突然被浏览器报不安全,排查发现是HTTPS证书链不完整加安全响应头缺失。本文记录了证书链补全、CSP/HSTS等安全响应头配置和Mixed Content修复的完整过程,以及5个实际踩过的坑。
|
22天前
|
人工智能 Java 开发工具
阿里开源 AI 代码审查神器 OpenCodeReview:让 AI 真正读懂你的 Git Diff
阿里开源的 OpenCodeReview 是一款专为 AI 代码审查设计的 CLI Agent 工具。它通过确定性工程(文件筛选、分组、规则匹配、敏感过滤)与智能 Agent 协同,解决传统大模型直接 Review Git Diff 时的上下文缺失、误判、Token 浪费等问题。支持多语言、自定义规则、CI 集成及 JSON 输出,兼顾精度与生产可用性。(239字)
725 0
|
2月前
|
人工智能 Java Apache
Apache Jena 详解:Java 开发者如何真正搭起一套知识图谱与语义服务
Apache Jena 是 Java 生态中成熟的语义网开源框架,提供 RDF 存储、SPARQL 查询、TDB2 图数据库、Fuseki 服务端、本体建模、逻辑推理与 SHACL 验证等全栈能力,是构建企业级知识图谱与 AI 语义后端的理想基础设施。(239字)
361 1
Apache Jena 详解:Java 开发者如何真正搭起一套知识图谱与语义服务
|
22天前
|
存储 缓存 自然语言处理
身份证二要素实名认证接口|姓名 + 身份证号一致性核验方案,快速完成业务实名核验接入
本文以云市场身份证二要素实名认证接口为对象,介绍姓名与身份证号一致性核验的完整接入方案:接口参数设计与两种鉴权方式(APPCODE 简单认证、AppKey/AppSecret 签名认证)、多语言调用示例、返回结构解析与业务错误码排查(0 匹配、1 不匹配、2 无此号码、12 号码不合法、101/103 频控),以及前置校验、同证件 60 秒冷却与 24 小时级频控、敏感信息脱敏存储等工程实践要点,适合需要在注册、开卡、信贷、政务办事等流程中落地实名核验环节的开发者参考。
502 0
身份证二要素实名认证接口|姓名 + 身份证号一致性核验方案,快速完成业务实名核验接入
|
23天前
|
数据采集 JavaScript 前端开发
房产数据对比爬虫:同时爬取链家+贝壳+安居客,做房价横向对比
本文详解如何突破链家/贝壳(JS渲染+字体反爬)与安居客(动态Token+请求头校验)的差异化反爬机制,基于适配器模式构建跨平台爬虫架构,结合站大爷隧道代理实现IP隔离,并通过小区名+户型+面积模糊匹配,完成房价横向对比分析,助力识别虚高挂牌与低价引流。
198 1
|
23天前
|
BI API 语音技术
阿里云百炼平台新人免费额度完整实操指南:领取规则、额度查看、用完即停与API代码调用全解
对于初次接触大模型开发、原型验证、智能应用搭建的个人开发者与企业技术团队来说,平台新人免费额度是降低试错成本的重要资源。开发者可以借助免费额度完成模型能力验证、应用原型调试、业务场景POC测试,不用一开始就投入按量付费成本。百炼大模型服务平台提供面向新开通用户的新人免费推理额度,但这套权益附带地域限制、有效期、额度隔离、账号共享、扣费防护等一系列复杂规则,如果对规则理解不到位,容易出现额度看不到、提前过期、子账号消耗完主账号额度、免费阶段产生意料之外账单等问题。本文完整梳理新人免费额度全部规则,讲解额度获取、多途径查看剩余额度、用完即停防护功能,附带可直接运行curl、Python调用代码,梳
279 1
|
22天前
|
消息中间件 存储 缓存
一次跨服务日志对不上的排查:traceId 生成、透传与采样的落地
一次请求跨四个服务、还经过消息队列异步处理,出问题后日志按关键词搜出七八条、时间线对不齐、链路在 MQ 处断裂。这篇讲分布式链路追踪的落地:traceId、spanId 与 W3C traceparent 头格式、入口生成与全链路复用、用 MDC 让每条日志自动带 traceId,以及两个易断链点——线程池用任务装饰器透传、消息队列用消息属性透传,最后给出头部采样加错误请求强制保留的采样策略和五个踩坑。
|
22天前
|
存储 安全 数据库管理
终端断网一上午,恢复后数据怎么不重不丢:本地队列、断网续传与冲突合并
从一台终端断网三小时、恢复后补传数据出现重复、丢失和互相覆盖说起,讲清离线优先数据同步的落地:本地 oplog 操作日志结构、clientOpId 幂等键与单调 seq 序号、按序小批量断点续传、服务端去重与缺口检测,以及多端并发修改时的版本号、字段级合并、最后写入获胜(LWW)与冲突标记,附五个踩坑。

热门文章

最新文章