R包:disgenet2r|DisGeNET的懒癌福利,一行代码多种可视化

简介: DisGeNET是整合基因-疾病关联数据的综合数据库,用于生物医学研究。disgenet2r是R包,方便访问DisGeNET数据,支持查询、检索和分析。最新版包含超百万基因-疾病关联。安装包时若遇到网络问题,可从GitHub下载源代码手动加载。常用功能包括检索单一疾病相关基因、多疾病联合分析及疾病富集。该包简化了数据获取和初步分析,适合初学者,但可视化定制性有限。

1.前言

image.png

DisGeNET是一个综合性的数据库,它集合了关于基因和人类疾病之间关联的信息。这个数据库涵盖了各种疾病和条件,提供了大量有关基因、变异和疾病之间联系的数据。DisGeNET数据集通常用于生物信息学和基因组学研究,特别是在疾病遗传学和药物发现领域。

image.png

disgenet2r包是一个用于R语言的工具,专为访问和分析DisGeNET数据库中的数据而设计。DisGeNET是一个包含了人类基因和疾病关联数据的综合性数据库。通过disgenet2r包,研究者可以在R环境中直接查询、检索和分析与基因和疾病相关的信息。

当前版本的 DisGeNET (v7.0) 包含 21671 个基因与 30170 个疾病、病症、性状和临床或异常人类表型之间的 1134942 个基因-疾病关联 (GDA),以及 194515 个变异与 14155 个疾病、性状和表型之间的 369554 个变异-疾病关联 (VDA)。

2.获取R包

# https://github.com/jinfar/disgenet2r
library(devtools)
install_bitbucket("ibi_group/disgenet2r")
library(disgenet2r)

有一位粉丝提到他那边怎么都下载不了,挂不挂梯都试了,网络环境问题。而且该包也没有提供本地包下载,小编提议暂时直接在github上下载压缩包,然后把主函数全部scoure一遍(无奈之策):

## 报错:
Downloading bitbucket repo ibi_group/disgenet2r@HEAD Error: Failed to install 'disgenet2r' from Bitbucket: error reading from connection

## 无奈之策:
list.files()
# [1] "DESCRIPTION"      "disgenet2r.Rproj" "inst"             "man"             
# [5] "NAMESPACE"        "R"                "README.md"        "vignettes"       
for (i in list.files("./R")) {
   
   
   source(paste0("./R/",i))
}

3.使用方法

加载完R包后先调用API,记得提前在DisGeNET官网中注册一个帐号,随便一个国内邮箱都可以,然后完成设置:

## 调用API
disgenet_api_key <- get_disgenet_api_key(
  email = "xxxx@126.com", 
  password = "******" )
Sys.setenv(DISGENET_API_KEY= disgenet_api_key)

下面列举几个常用的代码,可视化的形式就networkPiechartDiseaseClassVennHeatmapProteinClassBarplotLollipop。与不同用途排列组合起来以及例图太多太多了,使用前可以参考官网文档,都有一一列举。

3.1 检索单一疾病相关基因

可以修改疾病代号,替换参数中的diseasevocabulary即可,这里以精神分裂症(D012559)为例
| disease | vocabulary |
| :---------:| :--: |
|D012559|——|
| 181500| OMIM |
| 295 | ICD9CM |
| C3362 | NCI |
|HP:0100753|HPO|

data4 <- disease2gene( disease  = "181500", vocabulary = "OMIM",
                          database = "CURATED",
                          score    = c(0.4,1 ) )
data4
# Object of class 'DataGeNET.DGN'
# . Search:      single 
# . Type:        disease-gene 
# . Database:     CURATED 
# . Score:        0.4-1 
# . Term:        181500 
# . Results:  227

3.2 多疾病联合

## 疾病列表
diseasesOfInterest <- c("C0036341", "C0002395", "C0030567","C0005586")

## 检索
data5 <- disease2gene(
  disease = diseasesOfInterest,
  database = "CURATED",
  score =c(0.5,1),
  verbose  = TRUE )

## 可视化
plot( data5,
      class = "Network",
      prop = 1,
      verbose = T)
# The network contains 154 nodes and 170 edges.

image.png

3.3 疾病富集

list_of_genes <- disease2gene(disease = "C0004352", database = "GENOMICS_ENGLAND")
list_of_genes <- list_of_genes@qresult$gene_symbol
res_enrich <-disease_enrichment( entities =list_of_genes, vocabulary = "HGNC",
                                 database = "CURATED" )
table1 <- res_enrich@qresult[1:10, c("Description", "FDR", "Ratio",  "BgRatio")]
head(table1)
# Description          FDR Ratio  BgRatio
# 5              Autistic Disorder 3.188823e-30 20/20 261/9703
# 143      Intellectual Disability 1.677768e-11 13/20 447/9703
# 91    Global developmental delay 2.796271e-07  7/20 133/9703
# 126 Neurodevelopmental Disorders 9.257204e-07  6/20  93/9703
# 124    Autism Spectrum Disorders 2.067698e-05  5/20  85/9703
# 64             Abnormal behavior 1.107414e-04  3/20  16/9703

image.png

4.总结

这个R包是DisGeNET配套的R包,比较适合新手,或者懒癌患者。和官网上下载的结果是一样的,不过会方便很多,基本上一行代码就能出表或者出结果了。缺点就是可调整的参数不多,因此可视化结果会重复。要进阶的小伙伴可以拿这个R包检索结果,自行整理data.frame自行可视化。

赶紧用起来吧~

目录
相关文章
|
数据可视化
R语言绘图教程丨Nature论文都在用的多组比较箱线图,自动计算显著性并标注,附带误差线
R语言绘图教程丨Nature论文都在用的多组比较箱线图,自动计算显著性并标注,附带误差线
|
12月前
|
前端开发
如何在React Router中进行嵌套路由配置?
如何在React Router中进行嵌套路由配置?
583 57
|
机器学习/深度学习 人工智能 开发者
DeepSeek安装部署指南,基于阿里云PAI零代码,小白也能轻松搞定!
阿里云PAI平台支持零代码一键部署DeepSeek-V3和DeepSeek-R1大模型,用户可轻松实现从训练到部署再到推理的全流程。通过PAI Model Gallery,开发者只需简单几步即可完成模型部署,享受高效便捷的AI开发体验。具体步骤包括:开通PAI服务、进入控制台选择模型、一键部署并获取调用信息。整个过程简单快捷,极大降低了使用门槛。
2154 43
|
数据可视化 API 数据库
R包:disgenet2r|DisGeNET的懒癌福利,一行代码多种可视化
DisGeNET是一个综合性的数据库,包含大量关于人类基因和疾病关联的信息,常用于生物信息学和基因组学研究。disgenet2r是R语言工具,方便用户访问和分析DisGeNET数据。用户需注册DisGeNET账号并安装R包,通过disgenet2r包可查询、检索基因-疾病关联和变异-疾病关联数据。目前DisGeNET包含超过110万个基因-疾病关联和30万个变异-疾病关联。使用示例包括查询特定疾病相关基因和多疾病联合分析。
1172 0
|
机器学习/深度学习 编解码 自然语言处理
多模态大模型技术原理与实战(4)
本文介绍了多模态大模型的核心技术,包括数据集标注、数据表征、文本生成图像/语音/视频的方法、语音生成技术、视频生成模型以及跨模态融合技术。重点讨论了不同模型如GAN、VAE、Transformer和扩散模型的应用,并介绍了高效训练方法如Prefix Tuning、LORA等。此外,还详细描述了GPT-4的核心技术,如Transformer架构及其衍生物。
849 5
|
人工智能 运维 Cloud Native
重磅解读阿里云云网络领域关键技术创新
2023年10月31日,杭州·云栖大会,阿里云技术主论坛带来了一场关于阿里云主力产品与技术创新的深度解读,阿里云网络产品线负责人祝顺民带来《云智创新,网络随行》的主题发言,针对阿里云飞天洛神云网络(下文简称洛神网络)领域产品服务创新以及背后的技术积累进行了深度解读,不少背后的创新技术系首次重磅披露。
129867 16
|
机器学习/深度学习 算法
【机器学习】十大算法之一 “随机森林”
随机森林算法(Random Forest, RF)是由Leo Breiman和Adele Cutler于2001年提出的一种集成学习(Ensemble Learning)算法。它是由多个决策树构成的分类器,通过对每个决策树的投票结果来确定最终的预测结果。随机森林算法可以用于分类和回归分析。在分类问题中,每个决策树的输出结果为一个类别标签,通过投票来确定样本所属的类别。在回归问题中,每个决策树的输出结果为一个连续值,取所有决策树输出结果的平均值作为最终结果。可以处理高维度数据;可以处理不平衡的数据集。
2610 1
【机器学习】十大算法之一 “随机森林”
|
数据可视化
手把手教你使用 Quarto 构建文档 (2)
手把手教你使用 Quarto 构建文档 (2)
818 0

热门文章

最新文章