统计: 统计假设检验-比较方法的差别与选择

简介: 本文介绍了日常应用最广泛的几种基础的假设检验比较方法及其适用条件,以供参考学习

1、统计检验方法概览

在日常应用中,最广泛接触的就是两组间比较的情况,多应用 独立样本配对样本 条件下的 t检验秩和检验 方法。
对于多组比较的情况,使用的是 单因素方差分析(ANOVA) ,其中 t检验方差分析(ANOVA) 的差别在于比较的组数不同。

>参数与非参数 检验方法的选择:【 只有当变量满足正态性和方差齐性的条件下,才选用参数检验, 否则选用非参数方法。】

2、统计方法选择


2.1 计量-计数-等级 变量辨析

  • 计量变量:这类变量的特点是具有一个连续的变化性,又称为连续性变量,可以在观测时被测量到具体的数值,通常有度量单位,例如患者的年龄、血压、心率等。统计指标 常用 均值+标准差 来描述。属于 定量观察的结果
  • 计数变量:这类变量又称为定性资料无序分类变量资料 , 是将观察对象按某种属性或类别的 计数,汇总计数得到的资料,分为二分类或多分类。一般无固有计量单位,离散型变量。统计指标是各属性(类别)的结构百分比等。例如生存/死亡人数(百分比)。属于 定性观察的结果
  • 等级变量:等级数据介于 定量观察和定性观察 之间。又称为 有序分类变量 资料。该变量的描述有等级或程度上的差别,但不能用数量来表示。特点是:有大小顺序。如评分(+,++,+++),满意度(差评,中评,好评)等等。等级变量一般转换为计数变量进行统计比较,但是检验方法上需要注意,由于相近的等级拥有更高的相似性,不能根据数值的绝对差异对结果进行统计分析,这样才能准确反映数据的一致性。


2.2 配对样本与独立样本辨析

  • 独立样本:对于需要进行比较的两组数据,如果 比较变量数据是在不同个体测量得到的,研究的是个体(群体)差异,称为独立样本数据。这种数据的比较应使用 独立样本的检验方法,3组及以上多组数据的检验应使用单因素方差分析;
  • 配对样本:对于需要进行比较的两组数据,如果 比较变量数据是对同一个体在不同条件下测量得到的,也就是两组数据中每个数据对都是对应同一个个体,则称为配对样本数据,如比较一个人服用某种药物前后,某种代谢产物的变化水平是否受到药物影响,这种数据的比较就属于 ·配对样本检验·

2.3 正态性与方差齐性

  • 满足正态性+方差齐参数检验
  • 满足正态性+方差不齐非参数检验参数检验
  • 不满足正态性非参数检验

    选用 参数与非参数,最主要的是看数据是否满足 正态性 ,对于满足正态分布的数据,方差齐与不齐对检验结果的影响不大。

    2.3.1 变量的正态性检验

    对于正态分布的判断,常用 Shapiro-Wilk(W检验)【适用于样本数 N <2000】Kolmogorov-Smirnov(D检验)【适用于样本数 N >2000】,当数据分布接近正态时有 W检验和D检验 给出 $p > 0.05$ 。除了这两种检验方法,还有其它描述数据正态性的方法如 箱线图,偏度系数,峰度系数等。

W检验与D检验对应的 R code

A <- c(-1.28,1.57,-0.12,0.22,-0.3,-0.43,-1.17,-0.56,-0.35,-0.04,-0.2,-0.81,-1.81,0.08,1.8,0.96,-0.2,-0.03,-1.7,1.07,-0.73,-0.44,1.35,-0.12,0.55,0.21,0.53,0.25,-0.8,0.63,0.76,-0.79,0.02,-0.13,0.71,-1.04,-0.32,1.32,-1.62,0.75,-0.07,-0.55,-1.23,-0.6,-1.34,0.51,-0.66,-0.45,0.64,-0.08)
shapiro.test(A)
ks.test(A)
2.3.2 变量的方差齐性检验

方差齐性主要看 Levene's 检验(该方法对正态性要求不严格,结果相对可靠) 结果,$p > 0.05$则方差齐。若方差齐,使用 t检验。如果方差不齐,则使用 矫正t检验 (记为t'),一般也常用 秩和检验的结果代替矫正t检验 的结果。

2.4 等级变量的检验方法选择 秩和检验-卡方检验

  • 卡方检验 探讨的是构成比例的分布,描述了分布轮廓的差异;当需要基于等级资料探讨群体的构成差异时, 首选 卡方检验
  • 秩和检验 探讨的是分布位置的差异,描述了平均位置的差别;当需要基于等级资料探讨群体平均程度的差异时, 首选 秩和检验

3、各种统计检验在R语言的实现:

参考: EDAV/latex/statistical_test_and_parameter_test_in_r.pdf at master · Kimtanyo/EDAV · GitHub
statistical_test_and_parameter_test_in_r

----

如何选择统计学方法?T检验、单因素方差分析、秩和检验、卡方检验到底应该选择哪一个?一个视频轻松搞定_哔哩哔哩_bilibili
R语言统计5:方差分析(ANOVA,F- test) - 简书 (jianshu.com)

目录
相关文章
|
存储 算法 C++
【C++】STL的基本用法
【C++】STL的基本用法
599 0
|
传感器 机器学习/深度学习 数据采集
2022年第十一届认证杯数学中国数学建模国际赛小美赛:C 题 对人类活动进行分类 建模方案及代码实现
本文提供了2022年第十一届认证杯数学中国数学建模国际赛小美赛C题"对人类活动进行分类"的建模方案和Python代码实现,包括数据预处理、特征提取、LSTM网络模型构建和训练评估过程。
556 11
2022年第十一届认证杯数学中国数学建模国际赛小美赛:C 题 对人类活动进行分类 建模方案及代码实现
|
机器学习/深度学习 自然语言处理 PyTorch
PyTorch 中的动态图与静态图:理解它们的区别及其应用场景
【8月更文第29天】深度学习框架中的计算图是构建和训练神经网络的基础。PyTorch 支持两种类型的计算图:动态图和静态图。本文旨在阐述这两种计算图的区别、各自的优缺点以及它们在不同场景下的应用。
4249 0
|
存储 数据挖掘 数据处理
掌握Pandas核心数据结构:Series与DataFrame的四种创建方式
本文介绍了 Pandas 库中核心数据结构 Series 和 DataFrame 的四种创建方法,包括从列表、字典、标量和 NumPy 数组创建 Series,以及从字典、列表的列表、NumPy 数组和 Series 字典创建 DataFrame,通过示例详细说明了每种创建方式的具体应用。
1377 67
|
数据采集 机器学习/深度学习 算法
Python基于Apriori关联规则算法实现商品零售购物篮分析
Python基于Apriori关联规则算法实现商品零售购物篮分析
|
机器学习/深度学习 数据采集 算法
探索Python科学计算的边界:NumPy、Pandas与SciPy在大规模数据分析中的高级应用
【10月更文挑战第5天】随着数据科学和机器学习领域的快速发展,处理大规模数据集的能力变得至关重要。Python凭借其强大的生态系统,尤其是NumPy、Pandas和SciPy等库的支持,在这个领域占据了重要地位。本文将深入探讨这些库如何帮助科学家和工程师高效地进行数据分析,并通过实际案例来展示它们的一些高级应用。
669 0
探索Python科学计算的边界:NumPy、Pandas与SciPy在大规模数据分析中的高级应用
|
算法 数据挖掘 Shell
「毅硕|生信教程」 micromamba:mamba的C++实现,超越conda
还在为生信软件的安装配置而烦恼?micromamba(micromamba是mamba包管理器的小型版本,采用C++实现,具有mamba的核心功能,且体积更小,可以脱离conda独立运行,更易于部署)帮你解决!
982 1
|
JavaScript C++ Shell
原型制作与图解——墨刀工具
原型制作与图解——墨刀工具
2497 0
原型制作与图解——墨刀工具
|
前端开发
iStack详解(二)——堆叠连接方式堆叠拓扑变动处理
iStack详解(二)——堆叠连接方式堆叠拓扑变动处理
679 6
国家自然科学基金委员会管理科学部认定的管理类30种重要期刊
A类: 1 管理科学学报 A 2 系统工程理论与实践 A  3 管理世界 A  4 数量经济技术经济研究 A  5 中国软科学 A  6 金融研究 A  7 中国管理科学 A  8 系统工程学报 A  9 会计研究 A  10系统工程理论方法应用 A  11 管理评论 A  12...
11616 0