《R语言数据分析与挖掘实战》——3.3 R语言主要数据探索函数

简介:

本节书摘来自华章计算机《R语言数据分析与挖掘实战》一书中的第3章,第3.3节,作者 张良均,云伟标,王路,刘晓勇,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.3 R语言主要数据探索函数

R提供了大量的与数据探索相关的函数,这些数据探索函数可大致分为统计特征函数与统计作图函数。本小节对R中主要的统计特征函数与统计作图函数进行介绍,并举例以方便理解。

3.3.1 统计特征函数

统计特征函数用于计算数据的均值、方差、标准差、分位数、相关系数、协方差等,这些统计特征能反映出数据的整体分布。本小节所介绍的统计特征函数如表3-7所示。

screenshot

(1)mean

功能:计算数据样本的算术平均数。

使用格式:
screenshot

计算样本X的均值n,样本X可为向量、矩阵或多维数组。

(2)exp(mean(log())

功能:计算数据样本的几何平均数。

使用格式:
screenshot

计算样本X的几何均值n,样本X可为向量、矩阵或多维数组。

(3)var

功能:计算数据样本的方差。

使用格式:
screenshot

计算样本X的方差v。若X为向量,则计算向量的样本方差。若X为矩阵,则v为X的各列向量的样本方差构成的行向量。

(4)sd

功能:计算数据样本的标准差。

使用格式:
screenshot

计算样本X的标准差,若样本X为向量,则计算向量的标准差。若X为矩阵,则s为X的各列向量的标准差构成的行向量。

(5)cor

功能:计算数据样本的相关系数矩阵。

使用格式:
screenshot

计算列向量x、y的相关系数矩阵R。其中,name和value的取值如表3-8所示。
screenshot

实例:计算两个列向量的相关系数,采用Spearman方法。

screenshot

(6)cov

功能:计算数据样本的协方差矩阵。

使用格式:
screenshot

计算样本X的协方差矩阵R。样本X可为向量或矩阵。当X为向量时,R表示X的方差。当X为矩阵时,cov(X)计算方差矩阵。
screenshot

函数等价于cov([x,y])。参数x、y为长度相等的列向量。

实例:计算20×5随机矩阵的协方差矩阵。

screenshot

(7)moment

功能:计算数据样本的指定阶中心矩。

使用格式:
screenshot

计算样本X的order阶次的中心矩m,参数order为正整数。样本X可为向量、矩阵或多维数组。

说明:一阶中心矩为0,二阶中心矩为用除数n得到的方差,其中n为向量X的长度或矩阵X的行数。使用此函数要加载e1071包。

实例:计算100个随机数的2阶中心矩。

screenshot

3.3.2 统计作图函数

通过统计作图函数绘制的图表可以直观地反映出数据及统计量的性质及其内在规律,如盒图可以表示多个样本的均值,误差条形图能同时显示下限误差和上限误差,最小二乘拟合曲线图能分析两变量间的关系。本小节所介绍的统计作图函数如表3-9所示。

screenshot

(1)barplot

功能:绘制简单条形图。

使用格式:

screenshot

绘制矩阵样本X的分类条形图,X是一个向量或者矩阵。其中,参数horiz是逻辑值,默认为FALSE,改成TRUE图形变为横向条形图,main、xlab、ylab分别表示图形标题、横轴和纵轴标题。

实例:绘制样本数据的条形图,样本由“A”、“B”、“C”三种类型的随机数据组成。绘制结果如图3-13所示。

screenshot

(2)pie

功能:绘制饼形图。

使用格式:
screenshot

绘制矩阵X中非负数据的饼形图。若X中非负元素和小于1,则函数仅画出部分的饼形图,且非负元素X(i,j)的值直接限定饼形图中扇形的大小;若X中非负元素和大于等于1,则非负元素X(i,j)代表饼形图中的扇形大小通过X(i,j)/Y的大小来决定,其中,Y为矩阵X中非负元素和。

实例:通过向量[1 3 1.5 4 1.5]画饼形图,并将第一部分分离出来。绘制结果如图3-14所示。

screenshot

(3)hist

功能:绘制二维条形直方图,可显示数据的分布情形。

使用格式:
screenshot

把向量X中的数值自动分组,各组距相等,条形图每一条的高度表示频率或者频数,默认freq=TRUE,即画出频数条形图,freq=FALSE时绘出频率条形图。

实例:绘制二维条形直方图,从1到999中随机抽取100个数,并对100取余数,得到100个1到99之间的随机数,保存在向量x中,对其绘制直方图。绘制结果如图3-15所示。

screenshot

(4)boxplot

功能:绘制样本数据的箱形图。

使用格式:
screenshot

绘制矩阵样本X的箱形图。其中,盒子的上、下四分位数和中值处有一条线段。箱形末端延伸出去的直线称为须,表示盒外数据的长度。如果在须外没有数据,则在须的底部有一点,点的颜色与须的颜色相同。其中,参数notch默认为FALSE,如果改为TRUE则绘制矩阵样本X的带刻槽的凹盒图。和别的绘图函数一样,也可以给horizontal赋值TRUE,使图形横过来。

实例:绘制样本数据的箱形图,样本由两组正态分布的随机数据组成。其中,一组数据均值为5,方差为2,另一组数据均值为7,方差为4,并且分别补充两个比较偏离均值的数,使图中可以出现离群点。绘制结果如图3-16所示。

screenshot

(5)plot

功能:绘制线性二维图、折线图、散点图。

使用格式:
screenshot

绘制Y对于X(即以X为横轴的二维图形),可以通过参数type指定绘制时图形的类型、样式,可以有“o”“l”“b”等,这三种分别表示散点、曲线和点线混合型。通过col参数可以设置多种颜色。

实例:在区间(0≤x≤2π)绘制一条蓝色的正弦曲线,绘制图形如图3-17所示。

screenshot

相关文章
|
11天前
|
数据采集 机器学习/深度学习 数据可视化
R语言从数据到决策:R语言在商业分析中的实践
【9月更文挑战第1天】R语言在商业分析中的应用广泛而深入,从数据收集、预处理、分析到预测模型构建和决策支持,R语言都提供了强大的工具和功能。通过学习和掌握R语言在商业分析中的实践应用,我们可以更好地利用数据驱动企业决策,提升企业的竞争力和盈利能力。未来,随着大数据和人工智能技术的不断发展,R语言在商业分析领域的应用将更加广泛和深入,为企业带来更多的机遇和挑战。
|
14天前
|
存储 数据采集 数据处理
R语言数据变换:使用tidyr包进行高效数据整形的探索
【8月更文挑战第29天】`tidyr`包为R语言的数据整形提供了强大的工具。通过`pivot_longer()`、`pivot_wider()`、`separate()`和`unite()`等函数,我们可以轻松地将数据从一种格式转换为另一种格式,以满足不同的分析需求。掌握这些函数的使用,将大大提高我们处理和分析数据的效率。
|
1天前
|
数据挖掘 PyTorch TensorFlow
|
11天前
|
数据采集 数据可视化 数据挖掘
R语言在金融数据分析中的深度应用:探索数据背后的市场智慧
【9月更文挑战第1天】R语言在金融数据分析中展现出了强大的功能和广泛的应用前景。通过丰富的数据处理函数、强大的统计分析功能和优秀的可视化效果,R语言能够帮助金融机构深入挖掘数据价值,洞察市场动态。未来,随着金融数据的不断积累和技术的不断进步,R语言在金融数据分析中的应用将更加广泛和深入。
|
11天前
|
数据采集 算法 搜索推荐
R语言营销数据分析:使用R进行客户分群的实践探索
【9月更文挑战第1天】R语言以其强大的数据处理和统计分析能力,在金融数据分析、营销数据分析等多个领域发挥着重要作用。通过R语言进行客户分群,企业可以更好地理解客户需求,制定精准的营销策略,提升市场竞争力和客户满意度。未来,随着大数据和人工智能技术的不断发展,R语言在营销数据分析中的应用将更加广泛和深入。
|
27天前
|
数据采集 算法 数据挖掘
10余位大佬+10余年经验的结晶:Python数据分析与挖掘实战
LinkedIn 对全球超过3.3亿用户的工作经历和技能进行分析后得出,目前最炙手可热的25 项技能中,数据挖掘排名第一。那么数据挖掘是什么? 数据挖掘是从大量数据(包括文本)中挖掘出隐含的、先前未知的、对决策有潜在价值的关系、模式和趋势,并用这些知识和规则建立用于决策支持的模型,提供预测性决策支持的方法、工具和过程。数据挖掘有助于企业发现业务的趋势,揭示已知的事实,预测未知的结果,因此“数据挖掘”已成为企业保持竞争力的必要方法。 今天给小伙伴们分享的Python数据分析与数据挖掘手册是10余位数据挖掘领域资深专家和科研人员,10余年大数据挖掘咨询与实施经验结晶。从数据挖掘的应用出发,以电力、
10余位大佬+10余年经验的结晶:Python数据分析与挖掘实战
|
14天前
|
数据采集 机器学习/深度学习 数据挖掘
R语言数据清洗:高效处理缺失值与重复数据的策略
【8月更文挑战第29天】处理缺失值和重复数据是数据清洗中的基础而重要的步骤。在R语言中,我们拥有多种工具和方法来有效地应对这些问题。通过识别、删除或插补缺失值,以及删除重复数据,我们可以提高数据集的质量和可靠性,为后续的数据分析和建模工作打下坚实的基础。 需要注意的是,处理缺失值和重复数据时,我们应根据实际情况和数据特性选择合适的方法,并在处理过程中保持谨慎,以避免引入新的偏差或错误。
|
12天前
|
数据采集 存储 数据可视化
R语言时间序列分析:处理与建模时间序列数据的深度探索
【8月更文挑战第31天】R语言作为一款功能强大的数据分析工具,为处理时间序列数据提供了丰富的函数和包。从数据读取、预处理、建模到可视化,R语言都提供了灵活且强大的解决方案。然而,时间序列数据的处理和分析是一个复杂的过程,需要结合具体的应用场景和需求来选择合适的方法和模型。希望本文能为读者在R语言中进行时间序列分析提供一些有益的参考和启示。
|
14天前
|
数据处理
R语言数据合并:掌握`merge`与`dplyr`中`join`的巧妙技巧
【8月更文挑战第29天】如果你已经在使用`dplyr`进行数据处理,那么推荐使用`dplyr::join`进行数据合并,因为它与`dplyr`的其他函数(如`filter()`、`select()`、`mutate()`等)无缝集成,能够提供更加流畅和一致的数据处理体验。如果你的代码中尚未使用`dplyr`,但想要尝试,那么`dplyr::join`将是一个很好的起点。
|
25天前
|
数据采集 算法 数据挖掘
10余位大佬+10余年经验的结晶:Python数据分析与挖掘实战
LinkedIn 对全球超过3.3亿用户的工作经历和技能进行分析后得出,目前最炙手可热的25 项技能中,数据挖掘排名第一。那么数据挖掘是什么? 数据挖掘是从大量数据(包括文本)中挖掘出隐含的、先前未知的、对决策有潜在价值的关系、模式和趋势,并用这些知识和规则建立用于决策支持的模型,提供预测性决策支持的方法、工具和过程。数据挖掘有助于企业发现业务的趋势,揭示已知的事实,预测未知的结果,因此“数据挖掘”已成为企业保持竞争力的必要方法。 今天给小伙伴们分享的Python数据分析与数据挖掘手册是10余位数据挖掘领域资深专家和科研人员,10余年大数据挖掘咨询与实施经验结晶。从数据挖掘的应用出发,以电力、

热门文章

最新文章