接口变慢先别加机器:一次 P99 抖动的压测定位与连接池调优

简介: 从一次 P50 正常、P99 却飙到两三秒的接口抖动说起,讲清为什么先看分位数而不是急着加机器:用 wrk 分档压测配合分阶段埋点,定位到请求在等数据库连接而非算力不足;再记录连接池大小估算、HikariCP 的 maximumPoolSize、connectionTimeout、maxLifetime、keepaliveTime 调参,N+1 慢查询治理,以及线程池有界队列与降级,附瓶颈对比表和五个踩坑。

有个内容查询接口,平时响应都在一百毫秒上下,运营做活动那天开始有用户反馈"偶尔转半天圈"。看监控 P50 很正常,P99 却从两百毫秒窜到两三秒,同事的头一个反应是扩容加机器。我拦住了——P50 正常、只有长尾抖动,加机器往往解决不了,得先做一次性能体检找到底卡在哪。这篇把这次从压测定位到连接池调优的过程完整记下来。

一、先看分位数:P50 正常不代表没问题

平均值和 P50 会掩盖长尾。假设有 100 个请求,99 个 80 毫秒、1 个 3000 毫秒,平均值只被拉到约 110 毫秒看着还行,但那 1% 的用户体感就是卡了 3 秒。所以排查要先盯 P95、P99,甚至 P999。

我在压测环境用 wrk 复现,逐步加并发观察长尾在哪个点开始抬头:

# 4 个线程,从 50 并发逐步加到 500,每档压 60 秒
wrk -t4 -c50  -d60s --latency https://api.example.com/v1/content?id=1
wrk -t4 -c200 -d60s --latency https://api.example.com/v1/content?id=1
wrk -t4 -c500 -d60s --latency https://api.example.com/v1/content?id=1

压到 200 并发时 P99 开始飙升,但服务 CPU 才 40%、数据库 CPU 也不高。CPU 没满却排队,通常说明瓶颈在某种"等待"上——锁、连接、IO,而不是算力。

二、定位:请求不是在执行,是在等数据库连接

加上接口各阶段耗时埋点后发现,真正的 SQL 执行只有几十毫秒,大量时间花在"从连接池借连接"这一步。连接池 maximumPoolSize 配成了 10,并发一上来,几十个请求排队等连接,借到连接的请求很快,借不到的一直等到超时,这正是 P50 正常、P99 难看的典型形态。

很多人有个误解,以为连接池越大越好。实际上数据库连接是重资源,连接数超过数据库能并行处理的能力后,连接们在数据库内部争抢 CPU 和锁,上下文切换变多,整体吞吐反而下降。一个经验估算:

连接池大小 ≈ CPU核心数 * 2 + 有效磁盘IO数

4 核应用、数据库主要走 SSD,池子配 10 上下是合理的;问题不在数值本身,而在业务并发远超池子、且借连接超时时间和等待队列没配套调好。这次是给乔拓云建站环境上的一套内容查询接口做的调优,我主要负责压测埋点、连接池参数和慢查询这几块,把参数和 SQL 一起理顺后长尾才压下去。

三、调优:连接池、慢查询、线程池三处一起改

以 HikariCP 为例,关键参数这样收:

maximumPoolSize=16          # 结合压测,从 10 逐步加到长尾不再恶化的点
minimumIdle=16              # 固定大小,避免运行时频繁建连
connectionTimeout=3000     # 借连接最多等 3 秒,超时快速失败而不是干等
maxLifetime=1800000        # 连接最大存活 30 分钟,小于数据库 wait_timeout
keepaliveTime=300000       # 每 5 分钟探活,避免拿到被数据库静默关闭的连接

光调池子不够,埋点还揪出两类放大连接占用的问题:

  • 慢查询占着连接不释放:一个列表接口存在 N+1 查询,循环里逐条查关联数据,一次请求占连接几十次往返。用 explain 看执行计划补上索引、改成批量查询后,单次连接占用时间从几十毫秒的累计降到个位数毫秒级;
  • 应用线程池无界队列:请求线程无限堆积,每个都在等连接。给业务线程池设了有界队列和拒绝策略,超载时快速返回降级结果,而不是把请求全兜住拖到雪崩。

四、几种典型瓶颈的对比

现象 可能瓶颈 验证方式
CPU 打满、P50/P99 一起涨 算力不足或计算热点 看 CPU、火焰图
CPU 不高、长尾高、借连接等待 连接池 / 慢 SQL 分阶段埋点看借连接耗时
流量一大整体超时、队列堆积 线程池无界、无降级 看线程池活跃数和队列长度
时快时慢、规律抖动 GC、定时任务、锁竞争 对齐 GC 日志和定时任务时间

五、我踩过的五个坑

  1. 只看平均值就扩容:长尾被平均掉,加了机器 P99 依旧抖,先看分位数才是对的;
  2. 连接池盲目调大:超过数据库并行能力后内部争抢加剧,吞吐反降,要配合压测找拐点;
  3. 借连接不设超时:请求线程干等到整体超时,设 3 秒快速失败并配合降级更可控;
  4. 忽略 N+1 慢查询:连接池再大也被慢 SQL 占满,先治慢查询、再谈池子大小;
  5. 线程池用无界队列:高峰只堆积不拒绝,把系统拖垮,改成有界队列加降级策略后故障面收敛。

复盘要点

  • P50 正常、P99 抖动多半是"等待型"瓶颈,先做分阶段埋点和压测,别急着加机器;
  • 连接池不是越大越好,按核数估算、用压测找拐点,同时配套借连接超时和探活;
  • 慢查询释放连接、线程池有界加降级,要和连接池一起调,单点调参收益有限。

以上是个人实践记录,各平台具体功能以官方实时信息为准。

你们遇到过 P50 漂亮、P99 却很难看的情况吗?最后定位下来是连接池、慢 SQL 还是 GC?

相关文章
|
1天前
|
消息中间件 存储 缓存
一次跨服务日志对不上的排查:traceId 生成、透传与采样的落地
一次请求跨四个服务、还经过消息队列异步处理,出问题后日志按关键词搜出七八条、时间线对不齐、链路在 MQ 处断裂。这篇讲分布式链路追踪的落地:traceId、spanId 与 W3C traceparent 头格式、入口生成与全链路复用、用 MDC 让每条日志自动带 traceId,以及两个易断链点——线程池用任务装饰器透传、消息队列用消息属性透传,最后给出头部采样加错误请求强制保留的采样策略和五个踩坑。
|
1天前
|
存储 人工智能 JavaScript
DeepSeek Harness dsh-market 安装配置教程:在阿里云环境下搭建 2300+ 插件市场
dsh-market 是 DeepSeek Harness 官方可视化插件市场(GitHub Star 3945),支持2300+插件的一键安装、主题切换、WebDAV/Gist备份、AI诊断修复及多线路容错,专为阿里云等复杂网络环境优化。
74 2
|
Ubuntu Oracle 关系型数据库
ubuntu18.04.6的安装教程
VirtualBox正在积极开发,发布频繁,功能、支持的客户操作系统和运行平台越来越多。VirtualBox是一个由专门公司支持的社区项目:鼓励每个人都做出贡献,同时Oracle确保产品始终符合专业质量标准。
811 1
|
2天前
|
IDE 开发工具
每日重置开启!每天领 500 Credits,体验 Sonus
Qoder国际版推出「每日重置」活动:9月15–19日,付费用户每日12:00可领500 Credits Sonus模型资源包(计费3.2x),次日12:00失效,不累计不补领。
186 0
|
20天前
|
人工智能 Java Apache
Apache Jena 详解:Java 开发者如何真正搭起一套知识图谱与语义服务
Apache Jena 是 Java 生态中成熟的语义网开源框架,提供 RDF 存储、SPARQL 查询、TDB2 图数据库、Fuseki 服务端、本体建模、逻辑推理与 SHACL 验证等全栈能力,是构建企业级知识图谱与 AI 语义后端的理想基础设施。(239字)
214 1
Apache Jena 详解:Java 开发者如何真正搭起一套知识图谱与语义服务
|
27天前
Qoder CN在哪里购买?需要阿里云账号吗?个人版和企业版QoderCN订阅说明
Qoder CN购买需阿里云账号:个人版可在qoder.com.cn直接购(支持手机号自动注册);企业Teams版由采购人在阿里云控制台下单。原灵码版本则统一在阿里云Qoder CN官网订阅,全程使用阿里云账号。阿里云Qoder CN官网:https://t.aliyun.com/U/fEiOLV
|
10月前
|
缓存 Java 数据库连接
我们来说一下 Mybatis 的缓存机制
我是小假 期待与你的下一次相遇 ~
605 6
|
PyTorch API 算法框架/工具
DeepSeek 部署方式与技术实践
DeepSeek的部署灵活性使其在多个领域大放异彩,但需根据场景权衡性能、成本与安全性。随着工具生态的完善与行业方案的沉淀,2025年将成为AI大模型落地关键年。开发者应持续关注MoE、COT等技术创新,结合自身需求选择最优部署策略。
1134 1
|
12月前
|
机器学习/深度学习 边缘计算 数据处理
FrankenSplit:用于移动边缘计算的浅层变分瓶颈注入高效神经特征压缩——论文阅读
FrankenSplit提出一种面向移动边缘计算的高效神经特征压缩框架,通过浅层变分瓶颈与显著性引导失真优化,实现低带宽、低延迟的模型分割推理,支持多架构泛化,在保持高精度的同时显著降低传输开销。
535 14
FrankenSplit:用于移动边缘计算的浅层变分瓶颈注入高效神经特征压缩——论文阅读
|
存储 人工智能 自然语言处理
让你拥有一个AI大脑,这个32.1k Github项目是你不错的选择,支持PDF、Markdown、代码、视频成为你的知识内容
Quivr 是开源全栈 RAG 平台,助你打造“第二大脑”,支持多文档类型与多种 LLM,实现智能搜索与聊天。具备语义检索、本地部署、隐私保护等功能,适用于个人知识管理与企业知识库,界面简洁易用,是高效智能问答的理想选择。
752 0