ggalluvial|炫酷桑基图(Sankey),你也可以秀

简介: ggalluvial|炫酷桑基图(Sankey),你也可以秀

本文首发于“生信补给站”公众号 https://mp.weixin.qq.com/s/yhMgkST-rVD6SaQS7R-eoA


桑基图(Sankey diagram),是一种特定类型的流程图,图中延伸的分支的宽度对应数据流量的大小,通常应用于能源、材料成分、金融等数据的可视化分析。

因1898年Matthew Henry Phineas Riall Sankey绘制的“蒸汽机的能源效率图”而闻名,此后便以其名字命名为“桑基图”。


载入R包,数据

本文使用TCGA数据集中的LIHC的临床数据进行展示,大家可以根据数据格式处理自己的临床数据。也可后台回复“R-桑基图”获得示例数据以及R代码。

#install.packages("ggalluvial")
library(ggalluvial)
library(ggplot2)
library(dplyr)
#读入LIHC临床数据
LIHC <- read.csv("TCGA_lihc.csv",header=TRUE)
#展示数据情况
head(LIHC)
   PATIENT_ID    AGE    SEX AJCC_PATHOLOGIC_TUMOR_STAGE OS_STATUS
1 TCGA-XR-A8TE less50   Male                   STAGE III    LIVING
2 TCGA-5R-AA1D less50 Female                   STAGE III    LIVING
3 TCGA-DD-A1EC less50 Female                     STAGE I    LIVING
4 TCGA-ED-A7PY less50 Female                    STAGE II    LIVING
5 TCGA-RC-A6M5 less50 Female                    STAGE IV    LIVING
6 TCGA-DD-A1EH less50   Male                   STAGE III    LIVING


summary(LIHC)

桑基图的数据结构需要节点权重等信息,ggalluvial 的输入数据可以是长数据亦可以是宽数据。

绘制桑基图


1 宽数据示例

   对临床数据进行简单的处理,得到后四个变量的频数,整理成宽数据:以下处理过程可参考数据处理|R-dplyr数据处理|数据框重铸

#分组计算频数
LIHCData <- group_by(data,AGE,SEX,AJCC_PATHOLOGIC_TUMOR_STAGE,OS_STATUS) %>% summarise(., count = n())
#查看宽数据格式
head(LIHCData)
 AGE    SEX    AJCC_PATHOLOGIC_TUMOR_STAGE OS_STATUS count
 <fct>  <fct>  <fct>                       <fct>     <int>
1 50to70 Female STAGE I                     DECEASED     11
2 50to70 Female STAGE I                     LIVING       16
3 50to70 Female STAGE II                    DECEASED      3
4 50to70 Female STAGE II                    LIVING       11
5 50to70 Female STAGE III                   DECEASED      8
6 50to70 Female STAGE III                   LIVING        9
绘制桑基图
ggplot(as.data.frame(LIHCData),
      aes(axis1 = AJCC_PATHOLOGIC_TUMOR_STAGE, axis2 = SEX, axis3 = AGE,
          y= count)) +
 scale_x_discrete(limits = c("AJCC_STAGE", "SEX", "AGE"), expand = c(.1, .05)) +
 geom_alluvium(aes(fill = OS_STATUS)) +
 geom_stratum() + geom_text(stat = "stratum", label.strata = TRUE) +
 theme_minimal() +
 ggtitle("Patients in the TCGA-LIHC cohort",
         "stratified by demographics and survival")

 


  • axis参数设置待展示的节点信息(柱子);
  • geom_alluvium参数设置组间面积连接,此处按生存状态分组;


2 长数据示例

ggplot2通常处理的都是长表格模式,使用to_lodes_form函数即可转换

#to_lodes_form生成alluvium和stratum列,主分组位于key列中
LIHC_long <- to_lodes_form(data.frame(LIHCData),
                             key = "Demographic",
                             axes = 1:3)
head(LIHC_long)
 OS_STATUS count alluvium Demographic stratum
1  DECEASED    11        1         AGE  50to70
2    LIVING    16        2         AGE  50to70
3  DECEASED     3        3         AGE  50to70
4    LIVING    11        4         AGE  50to70
5  DECEASED     8        5         AGE  50to70
6    LIVING     9        6         AGE  50to70
# 绘制桑基图

ggplot(data = LIHC_long,
      aes(x = Demographic, stratum = stratum, alluvium = alluvium,
          y = count, label = stratum)) +
 geom_alluvium(aes(fill = OS_STATUS)) +
 geom_stratum() + geom_text(stat = "stratum") +
 theme_minimal() +
 ggtitle("Patients in the TCGA-LIHC cohort",
         "stratified by demographics and survival")

3 状态变化的趋势

   vaccinations为R包内置数据集,可展示同一subject在不同survey状态下的response情况。

data(vaccinations)
levels(vaccinations$response) <- rev(levels(vaccinations$response))
ggplot(vaccinations,
      aes(x = survey, stratum = response, alluvium = subject,
          y = freq,
          fill = response, label = response)) +
 scale_x_discrete(expand = c(.1, .1)) +
 geom_flow() +
 geom_stratum(alpha = .5) +
 geom_text(stat = "stratum", size = 3) +
 theme(legend.position = "none") +
 ggtitle("vaccination survey responses at three points in time")

4 更多细节

vignette(topic="ggalluvial", package="ggalluvial")

   

   以上就是如何使用R-ggalluvial包绘制桑基图的简单介绍,可以自己动手展示了 🤭。



相关文章
|
数据挖掘 数据格式
跟着Cell学作图 | 6.时间序列分析(Mfuzz包)
这篇2020年发表在cell上关于新冠的组学文章里面有大量的生信内容。今天带大家复现其中的一个Supplemental Figure:时间序列分析图。
1609 0
跟着Cell学作图 | 6.时间序列分析(Mfuzz包)
|
区块链 数据安全/隐私保护 缓存
带你读《深入理解以太坊》之三:技术架构
这是一本从原理和实践两个层面系统、深入讲解以太坊技术的专著,从设计理念、技术架构、共识算法、智能合约、以太坊虚拟机、开发工具、DApp开发、企业以太坊解决方案、跨链技术等近10个方面进行了详细讲解,既适合初学者系统学习以太坊的原理和应用开发,又适合有一定基础的开发者深入掌握以太坊的底层运行机制。
|
6月前
|
存储 缓存 JSON
ESLint 全指南:从原理到实践,构建高质量的 JavaScript/TypeScript 代码
本文系统讲解ESLint的核心原理、配置详解与工程化实践,涵盖AST工作机制、TypeScript集成、Prettier协作、性能优化及CI/CD全流程集成,助你构建统一、健壮的前端代码质量体系。(238字)
379 1
|
数据安全/隐私保护
使用校园账号登录WOS(Web of Science)并检索文献
使用校园账号登录WOS(Web of Science)并检索文献
2485 0
|
传感器 算法 物联网
智能停车解决方案之停车场室内导航系统(二):核心技术与系统架构构建
随着城市化进程的加速,停车难问题日益凸显。本文深入剖析智能停车系统的关键技术,包括停车场电子地图编辑绘制、物联网与传感器技术、大数据与云计算的应用、定位技术及车辆导航路径规划,为读者提供全面的技术解决方案。系统架构分为应用层、业务层、数据层和运行环境,涵盖停车场室内导航、车位占用检测、动态更新、精准导航和路径规划等方面。
1515 4
|
存储 缓存 NoSQL
Nginx缓存
Nginx缓存
291 2
|
数据库 Python Windows
Python:Pycharm安装指南
1. 双击安装程序,点击Next。 2. 选择安装路径,Next。 3. 默认选项,添加环境变量,Next。 4. 保持默认设置,点击Install。 5. 安装完成后选择是否立即重启。
555 2
Python:Pycharm安装指南
|
运维 监控 安全
|
缓存 人工智能 算法
编写高效的Python脚本:性能优化的策略与技巧
编写高效的Python脚本需要综合考虑多个方面,包括代码结构、数据结构和算法选择等。本文将探讨在Python编程中提高脚本性能的方法,包括优化数据结构、选择合适的算法、使用Python内置函数以及通过并行和异步编程提升效率。这些技巧旨在帮助开发者在不同应用场景中编写出高性能的Python代码。
|
存储 机器学习/深度学习 算法
6个常用的聚类评价指标
评估聚类结果的有效性,即聚类评估或验证,对于聚类应用程序的成功至关重要。
1295 1