《R语言数据分析与挖掘实战》——3.3 R语言主要数据探索函数

简介:
+关注继续查看

本节书摘来自华章计算机《R语言数据分析与挖掘实战》一书中的第3章,第3.3节,作者 张良均,云伟标,王路,刘晓勇,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.3 R语言主要数据探索函数

R提供了大量的与数据探索相关的函数,这些数据探索函数可大致分为统计特征函数与统计作图函数。本小节对R中主要的统计特征函数与统计作图函数进行介绍,并举例以方便理解。

3.3.1 统计特征函数

统计特征函数用于计算数据的均值、方差、标准差、分位数、相关系数、协方差等,这些统计特征能反映出数据的整体分布。本小节所介绍的统计特征函数如表3-7所示。

screenshot

(1)mean

功能:计算数据样本的算术平均数。

使用格式:
screenshot

计算样本X的均值n,样本X可为向量、矩阵或多维数组。

(2)exp(mean(log())

功能:计算数据样本的几何平均数。

使用格式:
screenshot

计算样本X的几何均值n,样本X可为向量、矩阵或多维数组。

(3)var

功能:计算数据样本的方差。

使用格式:
screenshot

计算样本X的方差v。若X为向量,则计算向量的样本方差。若X为矩阵,则v为X的各列向量的样本方差构成的行向量。

(4)sd

功能:计算数据样本的标准差。

使用格式:
screenshot

计算样本X的标准差,若样本X为向量,则计算向量的标准差。若X为矩阵,则s为X的各列向量的标准差构成的行向量。

(5)cor

功能:计算数据样本的相关系数矩阵。

使用格式:
screenshot

计算列向量x、y的相关系数矩阵R。其中,name和value的取值如表3-8所示。
screenshot

实例:计算两个列向量的相关系数,采用Spearman方法。

screenshot

(6)cov

功能:计算数据样本的协方差矩阵。

使用格式:
screenshot

计算样本X的协方差矩阵R。样本X可为向量或矩阵。当X为向量时,R表示X的方差。当X为矩阵时,cov(X)计算方差矩阵。
screenshot

函数等价于cov([x,y])。参数x、y为长度相等的列向量。

实例:计算20×5随机矩阵的协方差矩阵。

screenshot

(7)moment

功能:计算数据样本的指定阶中心矩。

使用格式:
screenshot

计算样本X的order阶次的中心矩m,参数order为正整数。样本X可为向量、矩阵或多维数组。

说明:一阶中心矩为0,二阶中心矩为用除数n得到的方差,其中n为向量X的长度或矩阵X的行数。使用此函数要加载e1071包。

实例:计算100个随机数的2阶中心矩。

screenshot

3.3.2 统计作图函数

通过统计作图函数绘制的图表可以直观地反映出数据及统计量的性质及其内在规律,如盒图可以表示多个样本的均值,误差条形图能同时显示下限误差和上限误差,最小二乘拟合曲线图能分析两变量间的关系。本小节所介绍的统计作图函数如表3-9所示。

screenshot

(1)barplot

功能:绘制简单条形图。

使用格式:

screenshot

绘制矩阵样本X的分类条形图,X是一个向量或者矩阵。其中,参数horiz是逻辑值,默认为FALSE,改成TRUE图形变为横向条形图,main、xlab、ylab分别表示图形标题、横轴和纵轴标题。

实例:绘制样本数据的条形图,样本由“A”、“B”、“C”三种类型的随机数据组成。绘制结果如图3-13所示。

screenshot

(2)pie

功能:绘制饼形图。

使用格式:
screenshot

绘制矩阵X中非负数据的饼形图。若X中非负元素和小于1,则函数仅画出部分的饼形图,且非负元素X(i,j)的值直接限定饼形图中扇形的大小;若X中非负元素和大于等于1,则非负元素X(i,j)代表饼形图中的扇形大小通过X(i,j)/Y的大小来决定,其中,Y为矩阵X中非负元素和。

实例:通过向量[1 3 1.5 4 1.5]画饼形图,并将第一部分分离出来。绘制结果如图3-14所示。

screenshot

(3)hist

功能:绘制二维条形直方图,可显示数据的分布情形。

使用格式:
screenshot

把向量X中的数值自动分组,各组距相等,条形图每一条的高度表示频率或者频数,默认freq=TRUE,即画出频数条形图,freq=FALSE时绘出频率条形图。

实例:绘制二维条形直方图,从1到999中随机抽取100个数,并对100取余数,得到100个1到99之间的随机数,保存在向量x中,对其绘制直方图。绘制结果如图3-15所示。

screenshot

(4)boxplot

功能:绘制样本数据的箱形图。

使用格式:
screenshot

绘制矩阵样本X的箱形图。其中,盒子的上、下四分位数和中值处有一条线段。箱形末端延伸出去的直线称为须,表示盒外数据的长度。如果在须外没有数据,则在须的底部有一点,点的颜色与须的颜色相同。其中,参数notch默认为FALSE,如果改为TRUE则绘制矩阵样本X的带刻槽的凹盒图。和别的绘图函数一样,也可以给horizontal赋值TRUE,使图形横过来。

实例:绘制样本数据的箱形图,样本由两组正态分布的随机数据组成。其中,一组数据均值为5,方差为2,另一组数据均值为7,方差为4,并且分别补充两个比较偏离均值的数,使图中可以出现离群点。绘制结果如图3-16所示。

screenshot

(5)plot

功能:绘制线性二维图、折线图、散点图。

使用格式:
screenshot

绘制Y对于X(即以X为横轴的二维图形),可以通过参数type指定绘制时图形的类型、样式,可以有“o”“l”“b”等,这三种分别表示散点、曲线和点线混合型。通过col参数可以设置多种颜色。

实例:在区间(0≤x≤2π)绘制一条蓝色的正弦曲线,绘制图形如图3-17所示。

screenshot

相关文章
|
28天前
|
数据挖掘
r语言数据分析画数据相关性图热力图
r语言数据分析画数据相关性图热力图
25 1
|
4月前
|
搜索推荐 Linux Python
VET:一个基于R语言的VCF数据提取工具,支持按基因ID、物理位置、样品名称提取指定变异信息
VET:一个基于R语言的VCF数据提取工具,支持按基因ID、物理位置、样品名称提取指定变异信息
|
4月前
|
数据挖掘 Linux Python
R语言中实现多维数据交并补集合运算,利用tidyverse系列包,intersect、union、setdiff
R语言中实现多维数据交并补集合运算,利用tidyverse系列包,intersect、union、setdiff
R语言中实现多维数据交并补集合运算,利用tidyverse系列包,intersect、union、setdiff
|
4月前
|
数据挖掘 Linux 数据处理
R语言笔记丨数据的创建和转换
R语言笔记丨数据的创建和转换
R语言笔记丨数据的创建和转换
|
4月前
|
数据挖掘
R语言笔记丨数据的合并、拆分、整合
R语言笔记丨数据的合并、拆分、整合
|
4月前
|
机器学习/深度学习 分布式计算 并行计算
探索UCI心脏病数据:利用R语言和h2o深度学习构建预测模型
本文的研究目的是基于UCI心脏病数据集[1],利用R语言和h2o深度学习框架构建一个预测模型,旨在准确预测个体患心脏病的风险。通过使用该模型,医疗专业人员可以更好地进行早期干预和预防措施,从而提高患者的生活质量和健康状况。
297 0
|
4月前
|
数据采集 数据可视化 数据挖掘
使用R语言绘制富集条形图,轻松分析基因表达数据
为了实现富集分析和绘制富集条形图,我们可以使用R语言。R语言是一种免费开源的编程语言和软件环境,用于统计计算,绘制图表和数据分析。它在大量生物信息学数据分析中得到应用,并成为当前技术最前沿的生物信息学研究领域。如此优势的R语言支持,是进行富集分析和富集条形图的理想之选。
148 0
|
4月前
|
数据采集 机器学习/深度学习 人工智能
数据清洗、数据处理入门!R语言我来了,数据不再零散!
「数据清洗」和「预处理」是数据科学中必不可少的一部分,它们能够帮助我们准确地分析和预测未来趋势。如果你曾经尝试过进行分析或建模,你会发现数据往往不像我们所想象的那样干净、整洁。需要对数据进行仔细的检查、清理和处理,才能真正把数据转变成有用的信息。
69 0
|
4月前
|
存储 数据采集 数据可视化
如何用R语言分析COVID-19相关数据
COVID-19是当前全球面临的一项重大挑战。 本文将介绍如何使用R语言分析COVID-19相关数据,探索其感染率、死亡率和人口特征的相关性,以及使用统计建模方法预测COVID-19的死亡率。
42 0
|
6月前
R语言-创建空数据框(Empty Data Frame )用于追加数据
本文分享了如何在R语言通过创建空数据框来实现追加数据的简单实现方法,以供参考
431 0
热门文章
最新文章
推荐文章
更多