《大数据分析原理与实践》一一3.4 小结

简介: 本节书摘来自华章出版社《大数据分析原理与实践》一 书中的第3章,第3.4节,作者:王宏志 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.4 小结
关联分析模型用于描述多个变量之间的关联,这是大数据分析的一种重要模型,本章主要探讨了回归分析、关联规则分析和相关分析这三类关联分析。3.1节介绍了回归分析模型,即描述一个或多个变量与其余变量的依赖关系,包括其基本定义和数学模型,并介绍了回归分析的基本计算方法和模型检验,紧接着介绍了回归模型的拓展,包括多项式回归、GBDT回归和XGBOOST回归,并且简要介绍了“回归大家族”,让读者对于整个回归问题有了全面的了解。3.2节讲述了关联规则分析模型,即查找存在于项目集合或对象集合之间的频繁模式、关联、相关性或因果结构。3.3节讨论了相关关系这种非确定性的关系,介绍了应用典型变量的典型相关分析问题,并介绍了阿里云的相关分析组件和相关实例。
习题

  1. 从20个样本中得到的有关回归结果是:SSR=60,SSE=40。要检验x与y之间的线性关系是否显著,即检验假设H0?∶?β1= 0。
    (1)线性关系检验的统计量F值是多少?

(2)给定显著性水平a=0.05,Fa是多少?
(3)是拒绝原假设还是不拒绝原假设?
(4)假定x与y之间是负相关,计算相关系数r。
(5)检验x与y之间的线性关系是否显著?

  1. 研究某一化学反应过程中温度x (℃)对产品成品率y (%)的影响,现测得若干数据(见表3-11):
    image

设对于给定的x、y为正态变量,且方差与x无关。
(1)试求线性回归方程;
(2)检验线性回归的合理性(取α = 0.05);
(3)若回归效果显著,试求x=135处y的置信度为0.95的预测区间。

  1. 某种水泥凝固时释放的热量y(cal/g)与3种化学成分x1、x2、x3(%)有关。现将观测的13组数据列于表3-12:
    image

试求y对x1、x2、x3的线性回归方程并作出检验(取α=0.05)。

  1. 一种合金在某种添加剂的不同浓度x (%)下其延伸系数y会有变化,为了研究这种关系,现进行16次试验,测得数据如下(见表3-13):
    image

(1)作出散点图。
(2)以=a0+a1x+a2x2为回归方程,确定其系数a0、a1、a2。

  1. 随机干扰项与残差项是否为一回事?若不是,写出二者的区别与联系。
  2. 为什么用R2评价拟合优度,而不用残差平方和作为评价的标准?
  3. (实现)从UCI数据集(https://archive.ics.uci.edu/ml/)中选取数据集,简单实现GDBT算法。
  4. 图3-22为购物篮事务:image

(1)计算{饼干},{啤酒,尿布},{啤酒,尿布,饼干}的支持度。
(2) 使用1)的计算结果,计算关联规则{啤酒,尿布}-> {饼干},{饼干}->{啤酒,尿布}的置信度。置信度是对称的度量吗?
(3)找出一对项a和b,使得规则{a}->{b}与{b}->{a}具有相同的置信度。

  1. 表3-14汇总了超市的事务数据。其中,cola表示包含可乐的事务,cola表示不包含可乐的事务,hamburgers表示包含汉堡包的事务,hamburgers表示不包含汉堡包的事务。
    image

(1) 假设挖掘出来关联规则{hambuger}->{cola}。给定最小支持度阈值是25%,最小置信度阈值为50%,该关联规则是强规则吗?
(2)根据给定的数据,买cola独立于买hamburger吗?如果不是,二者之间存在何种相关关系?

  1. 检查5位同学的学习时间与学习分数(见表3-15):
    image

学习时间与学习分数是否相关?若相关,求出其相关系数。

  1. 对140名学生进行了阅读速度x1、阅读能力x2、运算速度y1和运算能力y2的4种测验,所得成绩的相关系数矩阵为
    R=image

试对阅读本领与运算本领之间进行典型相关分析。

相关文章
|
4月前
|
人工智能 运维 安全
2025AI数字人企业年终盘点:TOP10厂商的技术路径与市场战略解析
面对数字人市场蓬勃发展,企业如何选型成关键。本文从技术、生态、合规三大维度,对比头部厂商实践,揭示选择核心:技术决定上限,生态影响融合,安全守住底线,助力政企实现虚实融合的长期数字化转型。
169 0
|
10月前
|
机器学习/深度学习 人工智能 自然语言处理
AI 大模型浪潮下,中小企业的机遇与破局之道
选择合适的大模型服务提供商是关键,目前市场上有许多大模型服务提供商,如百度的文心一言、阿里的通义千问、腾讯的混元大模型等,它们提供了丰富的 API 接口和定制化服务,中小企业可以根据自身需求和预算,选择适合自己的大模型服务,无需自行搭建复杂的技术架构和训练模型,降低了技术门槛和成本。
|
弹性计算 运维 测试技术
ECS快照
云盘快照是在特定时间点对云盘数据状态的备份,首次快照为全量备份,之后的快照仅保存变化数据。快照功能包括手动和自动创建,可用于数据恢复、系统回滚、创建自定义镜像等场景。阿里云提供了多种快照操作,如创建、回滚、复制到其他地域等,并有不同的计费模式。在使用快照时,需要注意相关限制和配额。此外,阿里云还设有用户服务群,提供技术支持。
|
IDE 数据可视化 Java
Python语法高亮库Pygments
Python语法高亮库Pygments
841 0
|
存储 编解码 搜索推荐
如何在Windows和Mac上免费将蓝光转换为MKV?
蓝光光盘因能提供高质量的视频和音频内容而备受青睐,但其使用上的局限性却不容忽视。相比之下,MKV作为一种广受支持的视频格式,与大多数播放设备和平台都能完美兼容,为用户带来了更大的便利性和灵活性。
2543 0
|
前端开发 容器
揭秘Web前端布局秘籍:浮动,那个让你又爱又恨的布局神器,你真的了解它吗?
【8月更文挑战第23天】在Web前端设计中,浮动是一种关键布局技术,能让元素在文档流中灵活移动,实现文本环绕图片、多列布局等效果。元素通过CSS的 `float` 属性脱离正常文档流并移动到容器边缘,后续非浮动内容则围绕该元素排列。浮动可用于多列布局、导航菜单及图文混排。需注意清除浮动以避免布局问题,并处理可能导致的父元素高度塌陷。
433 0
|
负载均衡 安全 API
基于网关服务治理的研究与实践(四)API网关技术
API网关旨在对外提供针对所有API调用的统一入口,实现对微服务接口的统一接入、请求转发。API网关建立与各微服务的路由访问关系映射,并将客户端的请求转发至对应的后端服务实例。
2241 0
基于网关服务治理的研究与实践(四)API网关技术
|
Java BI 测试技术
Jmeter系列(40)- 详解 Jmeter CLI 模式
Jmeter系列(40)- 详解 Jmeter CLI 模式
529 0
Jmeter系列(40)- 详解 Jmeter CLI 模式
|
Kubernetes Ubuntu Linux
原来 Docker 容器中设置时区这么简单
大家好, 我是老麦。 今天我们一起讨论一下容器时区的问题。
27194 2

热门文章

最新文章

下一篇
开通oss服务