【Java类初始化死锁】记一次Cassandra死锁问题排查

简介: 背景最近压测Cassandra的时候,发现一个Cassandra进程一直没有完成初始化。经过排查后发现是死锁问题,这篇文章将会带领大家回顾整个排查过程,学习如何排查Java死锁问题,是一个非常值得学习的经验。

背景

最近压测Cassandra的时候,发现一个Cassandra进程一直没有完成初始化。经过排查后发现是死锁问题,这篇文章将会带领大家回顾整个排查过程,学习如何排查Java死锁问题,是一个非常值得学习的经验。

调查过程

1.问题发现

首先是启动后,通过Cassandra命令nodetool netstats观察何时进入NORMAL状态。如下图所示:
image
但是过了很久都没有进入NORMAL,一直处于STARTING状态。

2.jstack排查

想要知道为啥一直处于STARTING状态,当然是用Jstack去观察进程到底在做什么。
image

jstack显示主线程处于WAITING状态。这符合我们观察到的现象,因为确实一直卡在STARTING状态没有走下去。使主线程卡住的地方是
AbstractCommitLogSegmentManager.awaitAvailableSegment(),这时候需要去看具体的源码。看看这个wait调用会由谁通知解开。

3.分析源码

源码分析后得知:awaitAvailableSegment()在等待另一个线程创建Segment,也就是等待生产者创建好对应资源。而这个生产者的线程叫COMMIT-LOG-ALLOCATOR。所以我们再去看一眼刚才的jstack,看看这个线程在做什么。预想中的情况应该是这个生产者线程也卡在某个地方,或者因为未知异常退出了(退出时候没能通知等在awaitAvailableSegment()上的线程)。

4.排查问题线程

在jstack中找到COMMIT-LOG-ALLOCATOR
image

乍一看,蒙圈了。这个线程处于RUNNABLE状态,完全不符合我们预想中的情况。那这个线程明明在“运行”,为何没有把对应的Segment资源生产出来呢?一种可能是死循环了,逻辑没有往下走。通过多次jstack发现,stack总是在133这行。并且通过cat /proc/<pid>/task/<tid>/stat确认,这个线程确实没有在运行,卡在133这行。

这里获取tid的方法是通过将jstack中16进制的nid转换成10进制,printf %d 0x4b7f。输出:19327

然后我们继续,看133这行代码:
image

133这行代码,是非常简单的一个静态函数调用CommitLog.handleCommitError(),没有涉及任何锁。为何会卡死在这行上?为何jstack看到的状态却是RUNNABLE?

Java层面的工具已经不能解决问题了。这时候通过pstack命令,查看堆栈:
image

我们发现线程实际卡在JVM的InstanceKlass::initialize调用上,也就是卡在类初始化上了。第一反应就是类初始化死锁问题,回顾下133这行代码,调用了CommitLog.handleCommitError(),也就是访问到了CommitLog这个类。然后我们再去jstack里看一下,哪个线程在负责CommitLog的初始化,并且一直没初始化好。没错就是最开始我们看到卡住的主线程!
image

jstack中的clinit是表示进入类初始化。

5.水落石出

主线程 -> 进入CommitLog初始化流程 -> 调用awaitAvailableSegment() -> 等待 COMMIT-LOG-ALLOCATOR 完成资源生产

此时CommitLog类还没有初始化完成,主线程持有CommitLog类的锁。

COMMIT-LOG-ALLOCATOR -> 生产资源 -> 遇到异常,走到catch逻辑(133行)-> 133行访问CommitLog类 -> CommitLog仍然在初始化 -> 死锁产生

总结

Java类初始化死锁,往往是由于多个静态类相互之间的关系设计不好,互相访问,导致可能出现初始化时候死锁。排查这类问题,一般都是jstack,然后再结合代码分析。顺便提一下,前面提到的RUNNABLE状态,并不能表示线程就在运行,虽然大多数时候是。

Thread state for a runnable thread. A thread in the runnable state is executing in the Java virtual machine but it may be waiting for other resources from the operating system such as processor.
摘自:https://docs.oracle.com/javase/8/docs/api/java/lang/Thread.State.html

后续

最后这个问题,已经贡献到社区 CASSANDRA-15295 。如果你想使用稳定的Cassandra服务,欢迎试用阿里云Cassandra服务。如果你对Cassandra感兴趣,也欢迎加入社区讨论,扫描下方二维码进入。

image

相关文章
|
7月前
|
Java 编译器 API
Java 密封类:精细化控制继承关系
Java 密封类:精细化控制继承关系
412 83
|
5月前
|
安全 Java 数据建模
Java记录类:简化数据载体的新选择
Java记录类:简化数据载体的新选择
308 101
|
5月前
|
安全 Java 开发者
Java记录类:简化数据载体的新方式
Java记录类:简化数据载体的新方式
328 100
|
6月前
|
安全 IDE Java
Java记录类型(Record):简化数据载体类
Java记录类型(Record):简化数据载体类
514 143
|
4月前
|
存储 Java 索引
用Java语言实现一个自定义的ArrayList类
自定义MyArrayList类模拟Java ArrayList核心功能,支持泛型、动态扩容(1.5倍)、增删改查及越界检查,底层用Object数组实现,适合学习动态数组原理。
180 4
|
4月前
|
IDE JavaScript Java
在Java 11中,如何处理被弃用的类或接口?
在Java 11中,如何处理被弃用的类或接口?
267 5
|
4月前
|
编解码 Java 开发者
Java String类的关键方法总结
以上总结了Java `String` 类最常见和重要功能性方法。每种操作都对应着日常编程任务,并且理解每种操作如何影响及处理 `Strings` 对于任何使用 Java 的开发者来说都至关重要。
349 5
|
4月前
|
JSON 网络协议 安全
【Java】(10)进程与线程的关系、Tread类;讲解基本线程安全、网络编程内容;JSON序列化与反序列化
几乎所有的操作系统都支持进程的概念,进程是处于运行过程中的程序,并且具有一定的独立功能,进程是系统进行资源分配和调度的一个独立单位一般而言,进程包含如下三个特征。独立性动态性并发性。
254 1
|
4月前
|
Java Go 开发工具
【Java】(8)正则表达式的使用与常用类分享
正则表达式定义了字符串的模式。正则表达式并不仅限于某一种语言,但是在每种语言中有细微的差别。
317 1
|
4月前
|
存储 Java 程序员
【Java】(6)全方面带你了解Java里的日期与时间内容,介绍 Calendar、GregorianCalendar、Date类
java.util 包提供了 Date 类来封装当前的日期和时间。Date 类提供两个构造函数来实例化 Date 对象。第一个构造函数使用当前日期和时间来初始化对象。Date( )第二个构造函数接收一个参数,该参数是从1970年1月1日起的毫秒数。
242 1