缓存穿透、击穿、雪崩:商协会系统里的三层防护怎么做

简介: 本文剖析商协会系统缓存三大典型故障——穿透、击穿、雪崩,结合实战案例详解成因与对策:空值缓存防穿透、互斥锁/逻辑过期防击穿、随机过期+预热防雪崩,并强调键设计规范与核心监控指标。240字

商协会系统里,会员详情、活动详情这类数据读多写少,上缓存是标准动作。但上了缓存不等于高枕无忧——我们线上出过三次问题,事后复盘发现都是同一类原因:缓存并没有坏,是用法让它失效了。

这篇把三类典型故障的成因和对策整理一遍。

第一类是穿透:查询一个根本不存在的键。

会员id 是数字自增的,有人用脚本循环请求不存在的 ID,缓存里查不到,每次都打到数据库上。缓存形同虚设,数据库连接池很快被打满。

对策有两层。第一层是空值缓存——数据库也查不到的时候,往缓存里写一个空标记,过期时间设短一点,比如一分钟到五分钟。这样同一个不存在的 ID 在短时间内不会反复穿透。

第二层是布隆过滤器。它的作用是前置判断"这个键是否存在",不存在的直接返回,连缓存都不查。特点是内存占用极小,但有误判率——它会把不存在的判成存在(不会漏判),所以放行之后的请求仍然要走缓存和数据库。这个特性决定了它是用来挡掉大部分无效请求的,不是用来做精确判断的。

需要注意的是,布隆过滤器要在数据写入时同步添加,删数据时它不支持删除。会员这类基本不删的数据很合适;如果是频繁增删的场景,要考虑计数布隆过滤器或者定期重建。

第二类是击穿:某个热点键过期的瞬间,大量请求同时涌进来。

典型场景是热门活动的详情页。这个键被高频访问,正好在某一刻过期,成百上千个请求同时发现缓存没了,一起去查数据库、一起重建缓存。数据库在这一瞬间承受的压力,跟完全没上缓存时差不多。

对策是重建过程加互斥。第一个发现缓存失效的请求拿到锁去查库重建,其他请求要么短暂等待后重试读缓存,要么直接返回兜底数据。

async function getActivity(id) {
   
  const key = `act:detail:${
     id}`;
  const cached = await redis.get(key);
  if (cached) return JSON.parse(cached);

  const lockKey = `lock:rebuild:${
     id}`;
  const token = randomUUID();
  const got = await redis.set(lockKey, token, 'PX', 3000, 'NX');

  if (got) {
   
    try {
   
      const data = await db.activity.findById(id);
      // 数据库也没有,写空值防穿透
      await redis.set(key, JSON.stringify(data ?? {
   }), 'EX', 300 + Math.floor(Math.random() * 120));
      return data;
    } finally {
   
      await redis.eval(
        `if redis.call('GET', KEYS[1]) == ARGV[1] then return redis.call('DEL', KEYS[1]) else return 0 end`,
        1, lockKey, token
      );
    }
  }

  // 没拿到锁:短暂等待后重读缓存,拿不到就返回兜底
  await sleep(50);
  const retry = await redis.get(key);
  return retry ? JSON.parse(retry) : null;
}

这里有个改进点值得提:更好的做法是逻辑过期,也就是缓存里存一个业务上的过期时间戳,物理上永不过期。请求发现逻辑时间到了,返回旧值的同时触发异步重建。这样用户完全感觉不到延迟,也不会有集火。上面的代码是物理过期的互斥重建版本,逻辑更直白,适合大多数场景。

第三类是雪崩:大批键在同一时刻集体过期。

常见于批量预热或者定时任务刷新的场景——一次性把几千个会员详情写进缓存,过期时间都设成一样的,到点全部失效,数据库瞬间被压垮。

对策很简单:过期时间加随机抖动。比如基础过期时间三百秒,再加上零到一百二十秒的随机值,让失效时间分散开。上面代码里的那串随机数就是干这个的。

再稳妥一点可以做多级缓存:本地缓存加分布式缓存,本地的过期时间更短,即使分布式缓存整批失效,本地还能扛一阵。代价是一致性变差,适合对实时性要求不高的展示类数据。

还有个前置动作是预热。活动开放报名这种可预知的热点,提前把数据刷进缓存,别等流量来了再建。预热的时候也要注意打散过期时间,否则预热本身就成了雪崩的源头。

三个方案之外,有两条基础规则比什么都重要。

一是缓存的键设计要能失效。会员详情用 member:detail:${id} 这类带 ID 的键,改了数据能精确定位删除;不要用列表查询条件拼出来的复杂键,改一条数据你不知道该删哪些键。

二是监控要盯三个指标:缓存命中率、数据库 QPS、缓存键的数量变化。命中率突然掉下来通常说明有穿透或者雪崩正在发生,数据库 QPS 尖峰往往对应击穿。这三个指标不做告警,等用户反馈就晚了。

我们这边在跑的商会管理系统叫未来漫城·商会互联平台,会员和活动详情走的就是空值缓存加互斥重建这套,过期时间带随机抖动,热门活动开放前会做一次预热。上线之后再没出现过缓存失效导致的数据库压力。

最后提醒一句:这些防护都是成本。会员量小、访问量低的商协会,单靠空值缓存加随机过期就够了,别一上来就上布隆过滤器和逻辑过期。先把监控做好,看数据再决定加哪一层。

相关文章
|
6天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1520 0
|
6天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1134 0
|
15天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3799 4
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
3天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
655 0
|
2天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1449 2
|
7天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)