《大数据分析原理与实践》一一3.4 小结

简介: 本节书摘来自华章出版社《大数据分析原理与实践》一 书中的第3章,第3.4节,作者:王宏志 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.4 小结
关联分析模型用于描述多个变量之间的关联,这是大数据分析的一种重要模型,本章主要探讨了回归分析、关联规则分析和相关分析这三类关联分析。3.1节介绍了回归分析模型,即描述一个或多个变量与其余变量的依赖关系,包括其基本定义和数学模型,并介绍了回归分析的基本计算方法和模型检验,紧接着介绍了回归模型的拓展,包括多项式回归、GBDT回归和XGBOOST回归,并且简要介绍了“回归大家族”,让读者对于整个回归问题有了全面的了解。3.2节讲述了关联规则分析模型,即查找存在于项目集合或对象集合之间的频繁模式、关联、相关性或因果结构。3.3节讨论了相关关系这种非确定性的关系,介绍了应用典型变量的典型相关分析问题,并介绍了阿里云的相关分析组件和相关实例。
习题

  1. 从20个样本中得到的有关回归结果是:SSR=60,SSE=40。要检验x与y之间的线性关系是否显著,即检验假设H0?∶?β1= 0。
    (1)线性关系检验的统计量F值是多少?

(2)给定显著性水平a=0.05,Fa是多少?
(3)是拒绝原假设还是不拒绝原假设?
(4)假定x与y之间是负相关,计算相关系数r。
(5)检验x与y之间的线性关系是否显著?

  1. 研究某一化学反应过程中温度x (℃)对产品成品率y (%)的影响,现测得若干数据(见表3-11):
    image

设对于给定的x、y为正态变量,且方差与x无关。
(1)试求线性回归方程;
(2)检验线性回归的合理性(取α = 0.05);
(3)若回归效果显著,试求x=135处y的置信度为0.95的预测区间。

  1. 某种水泥凝固时释放的热量y(cal/g)与3种化学成分x1、x2、x3(%)有关。现将观测的13组数据列于表3-12:
    image

试求y对x1、x2、x3的线性回归方程并作出检验(取α=0.05)。

  1. 一种合金在某种添加剂的不同浓度x (%)下其延伸系数y会有变化,为了研究这种关系,现进行16次试验,测得数据如下(见表3-13):
    image

(1)作出散点图。
(2)以=a0+a1x+a2x2为回归方程,确定其系数a0、a1、a2。

  1. 随机干扰项与残差项是否为一回事?若不是,写出二者的区别与联系。
  2. 为什么用R2评价拟合优度,而不用残差平方和作为评价的标准?
  3. (实现)从UCI数据集(https://archive.ics.uci.edu/ml/)中选取数据集,简单实现GDBT算法。
  4. 图3-22为购物篮事务:image

(1)计算{饼干},{啤酒,尿布},{啤酒,尿布,饼干}的支持度。
(2) 使用1)的计算结果,计算关联规则{啤酒,尿布}-> {饼干},{饼干}->{啤酒,尿布}的置信度。置信度是对称的度量吗?
(3)找出一对项a和b,使得规则{a}->{b}与{b}->{a}具有相同的置信度。

  1. 表3-14汇总了超市的事务数据。其中,cola表示包含可乐的事务,cola表示不包含可乐的事务,hamburgers表示包含汉堡包的事务,hamburgers表示不包含汉堡包的事务。
    image

(1) 假设挖掘出来关联规则{hambuger}->{cola}。给定最小支持度阈值是25%,最小置信度阈值为50%,该关联规则是强规则吗?
(2)根据给定的数据,买cola独立于买hamburger吗?如果不是,二者之间存在何种相关关系?

  1. 检查5位同学的学习时间与学习分数(见表3-15):
    image

学习时间与学习分数是否相关?若相关,求出其相关系数。

  1. 对140名学生进行了阅读速度x1、阅读能力x2、运算速度y1和运算能力y2的4种测验,所得成绩的相关系数矩阵为
    R=image

试对阅读本领与运算本领之间进行典型相关分析。

相关文章
|
存储 弹性计算 架构师
云服务器基准性能测试
随着数字化的不断发展,企业 IT 上云早已是大势所趋,通常上云的第一步是选一款云服务器。然而云服务器的型号众多,如阿里云的云服务器规格就多达上百款(详见https://help.aliyun.com/document_detail/25378.html),因此在选择具体一款规格的云服务器时,通常需要对云服务器的性能做一个基准测试,然后再做一轮业务测试。本最佳实践适合利用标准的benchmark工具对云服务器的CPU、内存、网络和磁盘性能进行测试的场景。
2189 1
云服务器基准性能测试
|
6月前
|
人工智能 运维 安全
2025AI数字人企业年终盘点:TOP10厂商的技术路径与市场战略解析
面对数字人市场蓬勃发展,企业如何选型成关键。本文从技术、生态、合规三大维度,对比头部厂商实践,揭示选择核心:技术决定上限,生态影响融合,安全守住底线,助力政企实现虚实融合的长期数字化转型。
206 0
|
机器学习/深度学习 人工智能 数据挖掘
AI4Science之分子材料成像调研洞察
分子成像在材料科学中意义重大,通过位形空间、频率空间和光谱学等成像方法,揭示材料微观结构与动态变化。结合AI技术,可深入理解材料特性,解决能源、环境等问题。然而,该领域数据复杂,尚无统一的数据集和Benchmark,模型也处于初期阶段。本文从成像方法、任务类型、机器学习模型、数据集与Benchmark、Python工具包及通用模型等多个维度进行了调研,探讨了多模态数据利用、大规模数据集构建等关键问题,并列举了相关参考论文。
|
9月前
|
新能源
大盘择时:慎用固定均线!12年回测A股数据揭示择时策略的3大适应性缺陷
动量策略加入50日与200日均线择时后收益下降,主要因均线滞后、逻辑冲突及市场变化。解决方案包括动态调整择时参数、结合多指标验证、优化动量执行细节,提升策略适应性与收益表现。
|
10月前
|
Ubuntu 安全 小程序
linux|ubuntu.v18.10版本即将发布,linux桌面让您动心
如果你使用闭源系统,那永远也就别想了!有了这样的需求,也许最终将linux带到人类大众通用市场的是我们中国!
408 0
|
12月前
|
机器学习/深度学习 人工智能 自然语言处理
AI 大模型浪潮下,中小企业的机遇与破局之道
选择合适的大模型服务提供商是关键,目前市场上有许多大模型服务提供商,如百度的文心一言、阿里的通义千问、腾讯的混元大模型等,它们提供了丰富的 API 接口和定制化服务,中小企业可以根据自身需求和预算,选择适合自己的大模型服务,无需自行搭建复杂的技术架构和训练模型,降低了技术门槛和成本。
|
弹性计算 运维 测试技术
ECS快照
云盘快照是在特定时间点对云盘数据状态的备份,首次快照为全量备份,之后的快照仅保存变化数据。快照功能包括手动和自动创建,可用于数据恢复、系统回滚、创建自定义镜像等场景。阿里云提供了多种快照操作,如创建、回滚、复制到其他地域等,并有不同的计费模式。在使用快照时,需要注意相关限制和配额。此外,阿里云还设有用户服务群,提供技术支持。
|
SQL 安全 BI
基于jeecg-boot的nbcio-boot因升级mybatis-plus到3.5.3.1和JSQLParser 到4.6而引起的在线报表配置报错处理
基于jeecg-boot的nbcio-boot因升级mybatis-plus到3.5.3.1和JSQLParser 到4.6而引起的在线报表配置报错处理
556 0
|
人工智能 供应链 搜索推荐
2025年中国快消品企业CRM选型指南
本文围绕2025年中国快消品企业CRM选型展开。快消行业数字化转型加速,CRM至关重要,但企业转型面临诸多困境。文章提出CRM选型的常规标准,并对比纷享销客、用友、勤策等五家主流服务商。