R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享

简介: R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享

数据挖掘技术跨区域犯罪预警中的研究与应用尚处于起步阶段,许多跨区域犯罪预警业务信息系统还停留在初级处理水平,缺乏综合性的开发应用,智能化的分析研判,科学性的决策预警;缺乏对数据由微观到宏观的加工能力,由宏观数据到微观数据的问题发现手段点击文末“阅读原文”获取完整代码数据

相关视频

image.png

image.png

如何利用数据挖掘技术挖掘和提取潜藏在大量业务数据中具备关联性的规律趋势,提高跨区域犯罪预警执法效率与快速反应能力、及时预防和打击犯罪行为,为警务决策提供支持服务,是本文研究的重点。

在结合公安犯罪行为分析实际的基础上,进行了基于决策树算法的犯罪行为分析原型系统设计,提出了功能需求与系统流程图,介绍了原型系统模块构成和实现。

分析表明:运用数据挖掘技术对公安信息数据库中的海量数据进行挖掘处理,发现趋势规律,从而快速准确的辅助警务决策,在跨区域犯罪预警中具有重要的现实意义。

数据准备

本文使用社区与犯罪相关数据查看文末了解数据免费获取方式,其结合了人口普查的社会经济数据。通过相关的数据,我们将进行数据分析,得到想要的结果。社区犯罪本身与许多因素有关,Communities也提供了很多相关数据。因为数据有所缺失,在使用前我们进行了相关处理。

首先,我们取ViolentCrimesPerPop(total number ofviolent crimes per 100K popuation)作为因变量,与这些影响元素做回归分析,发现拟合的效果很差,而且结果也难以解读。

跨区域犯罪预警模型的建立

在结合公安犯罪行为分析实际的基础上,进行了基于决策树算法的犯罪行为分析原型系统设计与实验,提出了功能需求与系统流程图,介绍了原型系统模块构成和实现。实验及分析表明:运用数据挖掘技术对公安信息数据库中的海量数据进行挖掘处理,发现趋势规律,从而快速准确的辅助警务决策,在跨区域犯罪中具有重要的现实意义。

建立模型和评估优化

接下来我们通过画图来观察部分系数检验效果很好的变量:

79ec852f302813525ba3113eeb3ecb49.png

93651debc198014ee563105633b54d91.png

采用主成分分析降维

看图screeplot,考虑前6个主成分。

11d4de3dddba6be016a9161d6f9f7fea.png


6f16523c84ec87b84bbf3edfe3452dd5.png

可以看到检验效果还不错,再进一步观察:

dd010df30018fe71b8e8a70af968fb2b.png

观察图predict.jpg可以看到总体趋势确实接近,但是无法再进一步作更精确的预测,因而转向其他方法。

建立模型和优化

接下来,我们用决策树对communities分类

并找出那些对ViolentCrimesPerPop最有影响的因素

summary(D$ViolentCrimesPerPop)

d00988904ef5c33c0403f796cac1e52c.png

按1st Qu,3rd Qu划分,将社区评级为Good,Medium,Bad

plot(rp)
text(rp)

1f3fffa71e87c46dd7082e5f2d88124d.png

可以看到,决策树的主要的分类节点为

PctKids2Par: percentage of kids in familyhousing with two parents

HousVacant: number of vacant households

pctWInvInc: percentage of households withinvestment / rent income in 1989

OwnOccHiQuart: owner occupied housing -upper quartile value

NumIlleg: number of kids born to nevermarried

racePctWhite: percentage of population thatis caucasian

PersPerOccupHous: mean persons perhousehold

MalePctDivorce: percentage of males who aredivorced

使用决策树对communities进行分类并找出对ViolentCrimesPerPop(每人口的暴力犯罪数)最有影响的因素是一个很好的分析策略。决策树通过递归地将数据集分割成更小的、更纯的子集来工作,每个分割点都基于一个特定的特征值。

在给出的特征中对犯罪数有影响的因素有:

  • PctKids2Par:家庭住房中双亲家庭的孩子百分比
  • HousVacant:空置户数的数量
  • pctWInvInc:1989年拥有投资/租金收入的户数的百分比
  • OwnOccHiQuart:业主自住房的上四分位数价值
  • NumIlleg:从未结婚的孩子的数量
  • racePctWhite:白种人人口的百分比
  • PersPerOccupHous:每户平均人数
  • MalePctDivorce:离婚的男性百分比

模型发布和模型应用

·OwnOccHiQuart

函数关系不明确。但是大多数的点集中在左下角,正相关。

·NumIlleg

·racePctWhite

函数关系不明确。但是大多数的点集中在右下角,负相关。

image.png

预警模型的验证

我们对模型进行检测:

pre=predict(rp,A)
for(i in 1:3){
for (j in 1:1994)
if (pre[j,i]>=pre[j,1] &&pre[j,i]>

决策树分类效果不错,准确率大概0.742。可以预见,如果用组合算法的话,准确率会很高。

下面,我们将一半的数据用于训练。

boost(Rank~.,data=A[1:1000,])

efb18cc738fda1adcc88668258cd80aa.png

准确率约为0.860。

存在问题和相关建议

尽管开展了基于犯罪行为分析的决策树原型系统的设计,但还有许多不足之处,如数据表中的离散化数据缺少一定的灵活性,不能够完全反映复杂类型数据的信息,需要进一步改进;其次数据是基于内存而不是磁盘或磁盘组,也未能实现动态的加载数据,另外程序还有待于进一步优化以提高程序运行速度。

相关文章
|
30天前
|
Web App开发 数据可视化 数据挖掘
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)
利用R语言进行聚类分析实战(数据+代码+可视化+详细分析)
|
30天前
|
数据采集 数据可视化
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
利用R语言进行因子分析实战(数据+代码+可视化+详细分析)
|
30天前
|
移动开发 数据可视化
广义线性模型beta二项分布的淋巴结疾病风险预测可视化R语言2实例合集|附数据代码
广义线性模型beta二项分布的淋巴结疾病风险预测可视化R语言2实例合集|附数据代码
|
30天前
|
数据可视化 数据挖掘 API
【R语言实战】聚类分析及可视化
【R语言实战】聚类分析及可视化
|
30天前
|
机器学习/深度学习 数据可视化
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为2
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为
|
30天前
利用R语言进行典型相关分析实战
利用R语言进行典型相关分析实战
|
30天前
|
机器学习/深度学习 算法
R语言分类回归分析考研热现象分析与考研意愿价值变现
R语言分类回归分析考研热现象分析与考研意愿价值变现
|
30天前
|
数据可视化 定位技术
R语言贝叶斯INLA空间自相关、混合效应、季节空间模型、SPDE、时空分析野生动物数据可视化
R语言贝叶斯INLA空间自相关、混合效应、季节空间模型、SPDE、时空分析野生动物数据可视化
|
30天前
|
机器学习/深度学习 数据可视化 算法
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为1
R语言逻辑回归logistic模型ROC曲线可视化分析2例:麻醉剂用量影响、汽车购买行为
|
30天前
|
机器学习/深度学习 数据可视化 算法
R语言聚类分析、因子分析、主成分分析PCA农村农业相关经济指标数据可视化|数据分享
R语言聚类分析、因子分析、主成分分析PCA农村农业相关经济指标数据可视化|数据分享