《大数据分析原理与实践》一一3.2 关联规则分析

简介:

本节书摘来自华章计算机《大数据分析原理与实践》一书中的第3章,第3.2节,作者:王宏志 更多章节内容可以访问云栖社区“华章计算机”公众号查看。

3.2 关联规则分析

关联规则分析又称关联挖掘,就是在交易数据、关系数据或其他信息载体中,查找存在于项目集合或对象集合之间的频繁模式、关联、相关性或因果结构。或者说,关联分析是发现交易数据库中不同商品(项)之间的联系。比较常用的算法是Apriori算法和FPgrowth
算法。
关联可分为简单关联、时序关联、因果关联。关联规则分析的目的是找出数据库中隐藏的关联,并以规则的形式表达出来,这就是关联规则,其定义如下:
给定一个项集合I={I1,I2,…,Im}和一个交易数据库D,其中每个事务t是I的非空子集,即每一个交易都与一个唯一的标识符TID对应。关联规则是形如X→Y的蕴涵式,其中,X和Y是I的子集合,分别称为关联规则的前驱和后继。
关联规则的有效性通常用支持度和置信度来衡量。X→Y在D中的支持度(support)是D中事务同时包含X、Y的百分比,即S(X→Y)=P(X?∪?Y);其置信度(confidence)是D中事务已经包含X的情况下,包含Y的百分比,即C(X→Y)=P(X|Y)。
如果满足最小支持度阈值和最小置信度阈值,则认为关联规则是有趣的。如果某个项集的支持度大于等于设定的最小支持度阈值,则称这个项集为“频繁项集”,所有“频繁k-项集”组成的集合通常记作Lk。这些阈值通常根据数据分析的需要人为设定。
我们用一个例子来说明关联规则的相关概念。
例如,某胃肠医院对来院看病的病人提供了5种可做的检查,某天早上前9位病人做了这5项检查(见表3-5)。
表3-5 9位病人5项检查结果表单
image

在表3-5中,每一行表示一个事务,{腹部B超}、{胃镜}都是1-项集,{腹部B超,胃镜}是2-项集,{腹部B超,胃镜,碳14}是3-项集。
考虑规则{腹部B超,胃镜}→{碳14},由于{腹部B超,胃镜,碳14}的支持度计数为2,而事务的总数是9,所以规则的支持度为。规则的置信度是项集{腹部B超,胃镜,碳14}的支持度计数与项集{腹部B超,胃镜}支持度计数的商。而项集{腹部B超,胃镜}支持度计数为4,所以置信度为。
假定支持度计数大于3(不包括3)的项集都是频繁的,那么我们可以得出频繁-1项集有{腹部B超},{胃镜},{碳14},计数分别为6,7,6。而频繁-2项集有{腹部B超,胃镜},{腹部B超,碳14},{胃镜,碳14},计数分别为4,4,4。还可以发现,不存在其他的频繁项集。
支持度–置信度框架是有局限性的,支持度的缺点在于许多潜在的有意义的模式会由于含有支持度计数较小的项而被删去。置信度的缺陷则在于忽略规则后件中项集的支持度。
为了解决置信度的这个缺陷,引入了兴趣因子和提升度的概念。
提升度lift(X→Y)=
对于二元变量,提升度等价于兴趣因子,其定义如下:
I(X→Y)=
该度量解释如下:
I(X→Y)=

例如,lift (腹部B超→胃镜)=I (腹部B超→胃镜)

关联规则挖掘过程主要包含两个阶段:
先从数据集中找出所有的频繁项集,它们的支持度均大于等于最小支持度阈值。
由这些频繁项集产生关联规则,计算它们的置信度,然后保留那些置信度大于等于最小置信度阈值的关联规则。
关联规则挖掘的具体算法将在本书11.3节详细讨论。

相关文章
|
14天前
|
存储 消息中间件 监控
【Flume】Flume在大数据分析领域的应用
【4月更文挑战第4天】【Flume】Flume在大数据分析领域的应用
|
27天前
|
Cloud Native 数据处理 云计算
探索云原生技术在大数据分析中的应用
随着云计算技术的不断发展,云原生架构作为一种全新的软件开发和部署模式,正逐渐引起企业的广泛关注。本文将探讨云原生技术在大数据分析领域的应用,介绍其优势与挑战,并探讨如何利用云原生技术提升大数据分析的效率和可靠性。
|
1月前
|
存储 消息中间件 大数据
Go语言在大数据处理中的实际应用与案例分析
【2月更文挑战第22天】本文深入探讨了Go语言在大数据处理中的实际应用,通过案例分析展示了Go语言在处理大数据时的优势和实践效果。文章首先介绍了大数据处理的挑战与需求,然后详细分析了Go语言在大数据处理中的适用性和核心技术,最后通过具体案例展示了Go语言在大数据处理中的实际应用。
|
1月前
|
数据采集 运维 数据挖掘
API电商接口大数据分析与数据挖掘 (商品详情店铺)
API接口、数据分析以及数据挖掘在商品详情和店铺相关的应用中,各自扮演着重要的角色。以下是关于它们各自的功能以及如何在商品详情和店铺分析中协同工作的简要说明。
|
2月前
|
搜索推荐 数据挖掘 C++
数据分析方法-对比分析和用户画像
数据分析方法-对比分析和用户画像
67 1
数据分析方法-对比分析和用户画像
|
2月前
|
数据采集 数据可视化 数据挖掘
数据分析案例-汽车客户信息数据可视化分析
数据分析案例-汽车客户信息数据可视化分析
84 0
|
2月前
|
数据可视化 架构师 数据挖掘
数据分析案例-数据科学相关岗位薪资可视化分析
数据分析案例-数据科学相关岗位薪资可视化分析
51 0
|
2月前
|
数据采集 数据可视化 数据挖掘
数据分析案例-BI工程师招聘岗位信息可视化分析
数据分析案例-BI工程师招聘岗位信息可视化分析
58 0
|
2月前
|
API
GEE案例分析——利用sentinel-3数据计算空气污染指数(Air Pollution Index,简称API)
GEE案例分析——利用sentinel-3数据计算空气污染指数(Air Pollution Index,简称API)
104 0
|
2月前
|
数据可视化 搜索推荐 数据挖掘
数据分析案例-顾客购物数据可视化分析
数据分析案例-顾客购物数据可视化分析
96 0