【数据挖掘】关联规则挖掘 Apriori 算法 ( 关联规则 | 数据项支持度 | 关联规则支持度 )

简介: 【数据挖掘】关联规则挖掘 Apriori 算法 ( 关联规则 | 数据项支持度 | 关联规则支持度 )

文章目录

一、 关联规则

二、 数据项支持度

三、 关联规则支持度



参考博客 :


【数据挖掘】关联规则挖掘 Apriori 算法 ( 关联规则简介 | 数据集 与 事物 Transaction 概念 | 项 Item 概念 | 项集 Item Set | 频繁项集 | 示例解析 )





一、 关联规则


关联规则 是指 :


某些 项集 出现在一个 事务 中 ,


可以推导出 :


另外一些 项集 也出现在同一个 事务 中 ;



如 : 事物 2 22 : t 2 = { 莴 苣 , 尿 布 , 啤 酒 , 甜 菜 } t_2 = \{ 莴苣 , 尿布 , 啤酒 , 甜菜 \}t

2


={莴苣,尿布,啤酒,甜菜}


{ 啤 酒 } \{ 啤酒 \}{啤酒} 1 11 项集 出现在购买清单 事务 2 22 中 , { 尿 布 } \{ 尿布 \}{尿布} 1 11 项集 也出现在购买清单 事务 2 22 中 ;






二、 数据项支持度


支持度 表示 数据项 ( Item ) 在 事务 ( Transaction ) 中的 出现频度 ;



支持度公式 :


S u p p o r t ( X ) = c o u n t ( X ) c o u n t ( D ) \rm Support (X) = \cfrac{count (X)}{count (D)}Support(X)=

count(D)

count(X)




S u p p o r t ( X ) \rm Support (X)Support(X) 指的是 X \rm XX 项集的支持度 ;


c o u n t ( X ) \rm count (X)count(X) 指的是 数据集 D \rm DD 中含有项集 X \rm XX 的事务个数 ;


c o u n t ( D ) \rm count(D)count(D) 指的是 数据集 D \rm DD 的事务总数 ;



示例 : 【数据挖掘】关联规则挖掘 Apriori 算法 ( 关联规则简介 | 数据集 与 事物 Transaction 概念 | 项 Item 概念 | 项集 Item Set | 频繁项集 | 示例解析 ) 六、数据集、事物、项、项集合、项集 示例


数据集 D \rm DD 为 :


事物编号 事物 ( 商品 )

001 001001 奶粉 , 莴苣

002 002002 莴苣 , 尿布 , 啤酒 , 甜菜

003 003003 奶粉 , 尿布 , 啤酒 , 橙汁

004 004004 奶粉 , 莴苣 , 尿布 , 啤酒

005 005005 奶粉 , 莴苣 , 尿布 , 橙汁


项集 X = { 奶 粉 } \rm X=\{ 奶粉 \}X={奶粉} , 求该项集的支持度 ? \rm ??



根据上述公式 S u p p o r t ( X ) = c o u n t ( X ) c o u n t ( D ) \rm Support (X) = \cfrac{count (X)}{count (D)}Support(X)=

count(D)

count(X)


 计算支持度 ;



c o u n t ( X ) \rm count (X)count(X) 指的是 数据集 D \rm DD 中含有项集 X \rm XX 的事务个数 ;


含有 X = { 奶 粉 } \rm X=\{ 奶粉 \}X={奶粉} 项集的事务有 事务 1 \rm 11 , 事务 3 33 , 事务 4 44 , 事务 5 55 , 得出 :


c o u n t ( X ) = 4 \rm count (X) = 4count(X)=4



c o u n t ( D ) \rm count(D)count(D) 指的是 数据集 D \rm DD 的事务总数 ; 得出


c o u n t ( D ) = 5 \rm count(D) = 5count(D)=5



则计算支持度 :


S u p p o r t ( X ) = c o u n t ( X ) c o u n t ( D ) \rm Support (X) = \cfrac{count (X)}{count (D)}Support(X)=

count(D)

count(X)



S u p p o r t ( X ) = 4 5 \rm Support (X) = \cfrac{4}{5}Support(X)=

5

4







三、 关联规则支持度


关联规则 X ⇒ Y \rm X \Rightarrow YX⇒Y 的支持度 ,


等于 项集 X ∪ Y \rm X \cup YX∪Y 的支持度 ;


公式为 :


S u p p o r t ( X ⇒ Y ) = S u p p o r t ( X ∪ Y ) = c o u n t ( X ∪ Y ) c o u n t ( D ) \rm Support (X \Rightarrow Y) = Support (X \cup Y) = \cfrac{count (X \cup Y)}{count (D)}Support(X⇒Y)=Support(X∪Y)=

count(D)

count(X∪Y)




示例 : 数据集 D \rm DD 为 :


事物编号 事物 ( 商品 )

001 001001 奶粉 , 莴苣

002 002002 莴苣 , 尿布 , 啤酒 , 甜菜

003 003003 奶粉 , 尿布 , 啤酒 , 橙汁

004 004004 奶粉 , 莴苣 , 尿布 , 啤酒

005 005005 奶粉 , 莴苣 , 尿布 , 橙汁


求关联规则 尿 布 ⇒ 啤 酒 \rm 尿布 \Rightarrow 啤酒尿布⇒啤酒 的支持度 ? ??


上述问题等价于 , 项集 X = { 尿 布 , 啤 酒 } \rm X=\{ 尿布 , 啤酒 \}X={尿布,啤酒} 的支持度 ;



根据上述公式


S u p p o r t ( X ⇒ Y ) = S u p p o r t ( X ∪ Y ) = c o u n t ( X ∪ Y ) c o u n t ( D ) \rm Support (X \Rightarrow Y) = Support (X \cup Y) = \cfrac{count (X \cup Y)}{count (D)}Support(X⇒Y)=Support(X∪Y)=

count(D)

count(X∪Y)



计算支持度 ;



c o u n t ( X ∪ Y ) \rm count (X \cup Y)count(X∪Y) 指的是 数据集 D \rm DD 中含有项集 X ∪ Y \rm X \cup YX∪Y 的事务个数 ;


含有 X ∪ Y = { 尿 布 , 啤 酒 } \rm X \cup Y=\{ 尿布 , 啤酒 \}X∪Y={尿布,啤酒} 项集的事务有 事务 2 \rm 22 , 事务 3 33 , 事务 4 44 , 得出 :


c o u n t ( X ∪ Y ) = 3 \rm count (X \cup Y) = 3count(X∪Y)=3



c o u n t ( D ) \rm count(D)count(D) 指的是 数据集 D \rm DD 的事务总数 ; 得出


c o u n t ( D ) = 5 \rm count(D) = 5count(D)=5



则计算支持度 :


S u p p o r t ( X ⇒ Y ) = S u p p o r t ( X ∪ Y ) = c o u n t ( X ∪ Y ) c o u n t ( D ) \rm Support (X \Rightarrow Y) = Support (X \cup Y) = \cfrac{count (X \cup Y)}{count (D)}Support(X⇒Y)=Support(X∪Y)=

count(D)

count(X∪Y)



S u p p o r t ( X ) = S u p p o r t ( X ∪ Y ) = 3 5 \rm Support (X) = Support (X \cup Y) = \cfrac{3}{5}Support(X)=Support(X∪Y)=

5

3

 


目录
相关文章
|
2月前
|
存储 算法 大数据
Apriori算法和Eclat算法差异
Apriori算法和Eclat算法差异
|
3月前
|
数据可视化 算法 前端开发
基于python flask+pyecharts实现的中药数据可视化大屏,实现基于Apriori算法的药品功效关系的关联规则
本文介绍了一个基于Python Flask和Pyecharts实现的中药数据可视化大屏,该系统应用Apriori算法挖掘中药药材与功效之间的关联规则,为中医药学研究提供了数据支持和可视化分析工具。
125 2
|
4月前
|
存储 算法 大数据
Apriori算法和Eclat算法在性能上有哪些主要的差异
Apriori算法和Eclat算法在性能上有哪些主要的差异
|
17天前
|
算法 安全 数据安全/隐私保护
基于game-based算法的动态频谱访问matlab仿真
本算法展示了在认知无线电网络中,通过游戏理论优化动态频谱访问,提高频谱利用率和物理层安全性。程序运行效果包括负载因子、传输功率、信噪比对用户效用和保密率的影响分析。软件版本:Matlab 2022a。完整代码包含详细中文注释和操作视频。
|
2天前
|
算法 数据挖掘 数据安全/隐私保护
基于FCM模糊聚类算法的图像分割matlab仿真
本项目展示了基于模糊C均值(FCM)算法的图像分割技术。算法运行效果良好,无水印。使用MATLAB 2022a开发,提供完整代码及中文注释,附带操作步骤视频。FCM算法通过隶属度矩阵和聚类中心矩阵实现图像分割,适用于灰度和彩色图像,广泛应用于医学影像、遥感图像等领域。
|
3天前
|
算法 调度
基于遗传模拟退火混合优化算法的车间作业最优调度matlab仿真,输出甘特图
车间作业调度问题(JSSP)通过遗传算法(GA)和模拟退火算法(SA)优化多个作业在并行工作中心上的加工顺序和时间,以最小化总完成时间和机器闲置时间。MATLAB2022a版本运行测试,展示了有效性和可行性。核心程序采用作业列表表示法,结合遗传操作和模拟退火过程,提高算法性能。
|
4天前
|
存储 算法 决策智能
基于免疫算法的TSP问题求解matlab仿真
旅行商问题(TSP)是一个经典的组合优化问题,目标是寻找经过每个城市恰好一次并返回起点的最短回路。本文介绍了一种基于免疫算法(IA)的解决方案,该算法模拟生物免疫系统的运作机制,通过克隆选择、变异和免疫记忆等步骤,有效解决了TSP问题。程序使用MATLAB 2022a版本运行,展示了良好的优化效果。
|
3天前
|
机器学习/深度学习 算法 芯片
基于GSP工具箱的NILM算法matlab仿真
基于GSP工具箱的NILM算法Matlab仿真,利用图信号处理技术解析家庭或建筑内各电器的独立功耗。GSPBox通过图的节点、边和权重矩阵表示电气系统,实现对未知数据的有效分类。系统使用MATLAB2022a版本,通过滤波或分解技术从全局能耗信号中提取子设备的功耗信息。
|
3天前
|
机器学习/深度学习 算法 5G
基于MIMO系统的SDR-AltMin混合预编码算法matlab性能仿真
基于MIMO系统的SDR-AltMin混合预编码算法通过结合半定松弛和交替最小化技术,优化大规模MIMO系统的预编码矩阵,提高信号质量。Matlab 2022a仿真结果显示,该算法能有效提升系统性能并降低计算复杂度。核心程序包括预编码和接收矩阵的设计,以及不同信噪比下的性能评估。
18 3
|
14天前
|
人工智能 算法 数据安全/隐私保护
基于遗传优化的SVD水印嵌入提取算法matlab仿真
该算法基于遗传优化的SVD水印嵌入与提取技术,通过遗传算法优化水印嵌入参数,提高水印的鲁棒性和隐蔽性。在MATLAB2022a环境下测试,展示了优化前后的性能对比及不同干扰下的水印提取效果。核心程序实现了SVD分解、遗传算法流程及其参数优化,有效提升了水印技术的应用价值。
下一篇
无影云桌面