跟着Nature学作图:R语言ggplot2散点栅格化能够减小输出pdf的文件大小

简介: 跟着Nature学作图:R语言ggplot2散点栅格化能够减小输出pdf的文件大小

论文

A saturated map of common genetic variants associated with human height

https://www.nature.com/articles/s41586-022-05275-y

s41586-022-05275-y.pdf

代码没有公开,但是作图数据基本都公开了,争取把每个图都重复一遍

今天的推文重复论文中的Figure1

代码

setwd("data/20221014")
library(readxl)
fig1<-read_excel("Figure1.xlsx")
colnames(fig1)

library(tidyverse)
library(stringr)

str_replace_all("[0,5e-100]","\\(|5e-|\\]|\\[","") %>% 
  str_split_fixed(",",n=2) %>% 
  as.data.frame() %>% 
  pull(V1) %>% as.numeric()
str_replace_all("[0,5e-100]","\\(|5e-|\\]|\\[","") %>% 
  str_split_fixed(",",n=2) %>% 
  as.data.frame() %>% 
  pull(V2) %>% as.numeric()
fig1 %>% 
  mutate(max_value=str_replace_all(`P-value Caregory`,"\\(|5e-|\\]|\\[","") %>% 
           str_split_fixed(",",n=2) %>% 
           as.data.frame() %>% 
           pull(V1) %>% as.numeric(),
         min_value=str_replace_all(`P-value Caregory`,"\\(|5e-|\\]|\\[","") %>% 
           str_split_fixed(",",n=2) %>% 
           as.data.frame() %>% 
           pull(V2) %>% as.numeric()) %>% 
  mutate(group=case_when(
    min_value == 100 & max_value == 0  ~ "group01",
    min_value == 50 & max_value == 100 ~ "group02",
    min_value == 20 & max_value == 50 ~ "group03",
    min_value == 10 & max_value == 20 ~ "group04",
    min_value == 8 & max_value == 10 ~ "group05",
  )) -> new.fig1

table(new.fig1$group)

library(ggplot2)
library(ggh4x)
library(cowplot)

ggplot(data=new.fig1,
       aes(x=`Minor Allele Frequency`,
           y=`Join Effect of Minor Allele`,
           color=group))+
  geom_point( key_glyph = rectangle_key_glyph(color=color,
                                              fill=color,
                                              padding = margin(3, 3, 3, 3)))+
  scale_color_manual(values = c("group01"="#ee82ee",
                                "group02"="#2e8b57",
                                "group03"="#1e90ff",
                                "group04"="#daa520",
                                "group05"="#cdc673"),
                     name="",
                     labels=c("group01"="P < 5 × 10–100 (672 SNPs)",
                              "group02"="5 × 10–50 > P > 5 × 10–100 (1,110 SNPs)",
                              "group03"="5 × 10–20 > P > 5 × 10–50 (3,513 SNPs)",
                              "group04"="5 × 10–10 > P > 5 × 10–20 (5,192 SNPs)",
                              "group05"="5 × 10–8 > P > 5 × 10–10 (1,624 SNPs)"))+
  theme_bw()+
  theme(panel.grid = element_blank(),
        panel.border = element_blank(),
        axis.line = element_line(),
        legend.position = c(0.7,0.8))+
  scale_x_continuous(breaks = c(0.01,0.05,0.1,0.2,0.3,0.4,0.5),
                     labels = c(1,5,10,20,30,40,50))+
  scale_y_continuous(breaks = c(-0.3,-0.2,-0.1,0,0.1,0.2,0.3),
                     limits = c(-0.3,0.3))+
  guides(x=guide_axis_truncated(trunc_lower = 0.01,
                            trunc_upper = 0.5),
         y=guide_axis_truncated(trunc_lower = -0.3,
                                trunc_upper = 0.3))+
  labs(x="MAF (%) in cross-ancestry meta-analysis",
       y="Joint effect sizes (s.d.) of minor alleles\nin cross-ancestry meta-analysis")+
  geom_hline(yintercept = 0,color="gray")+
  geom_smooth(data = new.fig1 %>% 
                filter(group=="group01") %>%
                filter(`Join Effect of Minor Allele`<0),
              aes(x=`Minor Allele Frequency`,
                  y=`Join Effect of Minor Allele`),
              method = 'loess',
              formula = 'y~x',
              se=FALSE,color="gray",
              show.legend = FALSE)+
  geom_smooth(data = new.fig1 %>% 
                filter(group=="group01") %>%
                filter(`Join Effect of Minor Allele`>0),
              aes(x=`Minor Allele Frequency`,
                  y=`Join Effect of Minor Allele`),
              method = 'loess',
              formula = 'y~x',
              se=FALSE,color="gray",
              show.legend = FALSE)

image.png

关于曲线不太清楚是用什么数据做的,这里直接自动添加拟合曲线

图例里的文本上下标 出图后再编辑吧

关于散点图今天还新学到一个知识点是:散点图的点如果非常多,如果输出pdf文件的话,pdf文件会非常大,比如GWAS里常用的曼哈顿图,这个pdf文件如果非常大后续如果想要编辑这个pdf文件会比较麻烦。

关于如何解决这个问题,看到一个讨论群里有人讨论,他们提到一个办法是可以把散点栅格化 (栅格化是什么意思暂时不太明白)可以借助R包ggrastr

对应的github主页是

https://github.com/VPetukhov/ggrastr

正好我们今天的推文内容是数据量比较多的散点图,我们可以按照这个做法试试,这里参考微信公众号推文 https://mp.weixin.qq.com/s/ou0cjD8dLMNaDLk588KSwQ

安装ggrastr这个R包

install.packages('ggrastr')

如果要把点栅格化,只需要把对应的散点图函数geom_point()换成geom_point_rast()

library(ggrastr)
p2<-ggplot(data=new.fig1,
           aes(x=`Minor Allele Frequency`,
               y=`Join Effect of Minor Allele`,
               color=group))+
  geom_point_rast( key_glyph = rectangle_key_glyph(color=color,
                                              fill=color,
                                              padding = margin(3, 3, 3, 3)),
                   size=0.1,
                   raster.dpi = getOption("ggrastr.default.dpi", 300))+
  scale_color_manual(values = c("group01"="#ee82ee",
                                "group02"="#2e8b57",
                                "group03"="#1e90ff",
                                "group04"="#daa520",
                                "group05"="#cdc673"),
                     name="",
                     labels=c("group01"="P < 5 × 10–100 (672 SNPs)$)",
                              "group02"="5 × 10–50 > P > 5 × 10–100 (1,110 SNPs)",
                              "group03"="5 × 10–20 > P > 5 × 10–50 (3,513 SNPs)",
                              "group04"="5 × 10–10 > P > 5 × 10–20 (5,192 SNPs)",
                              "group05"="5 × 10–8 > P > 5 × 10–10 (1,624 SNPs)"))+
  theme_bw()+
  theme(panel.grid = element_blank(),
        panel.border = element_blank(),
        axis.line = element_line(),
        legend.position = c(0.7,0.8))+
  scale_x_continuous(breaks = c(0.01,0.05,0.1,0.2,0.3,0.4,0.5),
                     labels = c(1,5,10,20,30,40,50))+
  scale_y_continuous(breaks = c(-0.3,-0.2,-0.1,0,0.1,0.2,0.3),
                     limits = c(-0.3,0.3))+
  guides(x=guide_axis_truncated(trunc_lower = 0.01,
                                trunc_upper = 0.5),
         y=guide_axis_truncated(trunc_lower = -0.3,
                                trunc_upper = 0.3))+
  labs(x="MAF (%) in cross-ancestry meta-analysis",
       y="Joint effect sizes (s.d.) of minor alleles\nin cross-ancestry meta-analysis")+
  geom_hline(yintercept = 0,color="gray")+
  geom_smooth(data = new.fig1 %>% 
                filter(group=="group01") %>%
                filter(`Join Effect of Minor Allele`<0),
              aes(x=`Minor Allele Frequency`,
                  y=`Join Effect of Minor Allele`),
              method = 'loess',
              formula = 'y~x',
              se=FALSE,color="gray",
              show.legend = FALSE)+
  geom_smooth(data = new.fig1 %>% 
                filter(group=="group01") %>%
                filter(`Join Effect of Minor Allele`>0),
              aes(x=`Minor Allele Frequency`,
                  y=`Join Effect of Minor Allele`),
              method = 'loess',
              formula = 'y~x',
              se=FALSE,color="gray",
              show.legend = FALSE)

pdf("p1.pdf",width = 6,height = 6)
p1
dev.off()


pdf("p2.pdf",width = 6,height = 6)
p2
dev.off()

输出的p2如果放大 点是会变模糊的

image.png

两个文件的大小也不一样,栅格化之前是700k,栅格化之后只有200k

image.png

示例数据和代码可以给公众号推文点赞,点击在看,最后留言获取

欢迎大家关注我的公众号

小明的数据分析笔记本

小明的数据分析笔记本 公众号 主要分享:1、R语言和python做数据分析和数据可视化的简单小例子;2、园艺植物相关转录组学、基因组学、群体遗传学文献阅读笔记;3、生物信息学入门学习资料及自己的学习笔记!
相关文章
|
3月前
|
数据可视化 数据挖掘 图形学
R语言基础可视化:使用ggplot2构建精美图形的探索
【8月更文挑战第29天】 `ggplot2`是R语言中一个非常强大的图形构建工具,它基于图形语法提供了一种灵活且直观的方式来创建各种统计图形。通过掌握`ggplot2`的基本用法和美化技巧,你可以轻松地将复杂的数据转化为直观易懂的图形,从而更好地理解和展示你的数据分析结果。希望本文能够为你探索`ggplot2`的世界提供一些帮助和启发。
|
3月前
|
数据可视化
R语言自定义图形:ggplot2中的主题与标签设置
【8月更文挑战第30天】`ggplot2`作为R语言中功能强大的绘图包,其自定义能力让数据可视化变得更加灵活和多样。通过合理使用`theme()`函数和`labs()`函数,以及`geom_text()`和`geom_label()`等几何对象,我们可以轻松创建出既美观又富有表达力的图形。希望本文的介绍能够帮助你更好地掌握`ggplot2`中的主题与标签设置技巧。
|
5月前
|
Python
R语言遍历文件夹求取其中所有栅格文件的平均值
通过NAvalue(tif_file_all) <- -10000这句代码,将值为-10000的像元作为NoData值的像元,防止后期计算平均值时对结果加以干扰。   接下来,我们通过file.path()函数配置一下输出结果的路径——其中,结果遥感影像文件的名称就可以直接以其所对应的条带号来设置,并在条带号后添加一个_mean后缀,表明这个是平均值的结果图像;但此外,这个仅仅是文件的名字,还需要将文件名与路径拼接在一起,才可以成为完整的保存路径,因此需要用到file.path()函数。最后,将结果图像通过writeRaster()函数加以保存即可,这句代码的解释大家同样参考R语言求取大量遥感
181 0
|
6月前
|
存储 数据可视化 数据挖掘
R语言可视化:ggplot2冲积/桑基图sankey分析大学录取情况、泰坦尼克幸存者数据
R语言可视化:ggplot2冲积/桑基图sankey分析大学录取情况、泰坦尼克幸存者数据
|
6月前
|
算法 数据可视化
R语言社区检测算法可视化网络图:ggplot2绘制igraph对象分析物种相对丰度
R语言社区检测算法可视化网络图:ggplot2绘制igraph对象分析物种相对丰度
|
6月前
r语言ggplot2误差棒图快速指南
r语言ggplot2误差棒图快速指南
|
6月前
|
数据可视化
R语言ggplot2 对Facebook用户数据可视化分析
R语言ggplot2 对Facebook用户数据可视化分析
|
6月前
|
Java
Java PDF 相关 1、拷贝多个PDF到一个PDF,并且文件大小变小,文本等信息保留
1、合并多个PDF,并且文件变小,后面添加的文本信息保留
145 0
|
2月前
|
数据采集 机器学习/深度学习 数据可视化
R语言从数据到决策:R语言在商业分析中的实践
【9月更文挑战第1天】R语言在商业分析中的应用广泛而深入,从数据收集、预处理、分析到预测模型构建和决策支持,R语言都提供了强大的工具和功能。通过学习和掌握R语言在商业分析中的实践应用,我们可以更好地利用数据驱动企业决策,提升企业的竞争力和盈利能力。未来,随着大数据和人工智能技术的不断发展,R语言在商业分析领域的应用将更加广泛和深入,为企业带来更多的机遇和挑战。
|
28天前
|
数据挖掘 C语言 C++
R语言是一种强大的统计分析工具,提供了丰富的函数和包用于时间序列分析。
【10月更文挑战第21天】时间序列分析是一种重要的数据分析方法,广泛应用于经济学、金融学、气象学、生态学等领域。R语言是一种强大的统计分析工具,提供了丰富的函数和包用于时间序列分析。本文将介绍使用R语言进行时间序列分析的基本概念、方法和实例,帮助读者掌握R语言在时间序列分析中的应用。
42 3