SQL Server聚类数据挖掘信用卡客户可视化分析

本文涉及的产品
RDS SQL Server Serverless,2-4RCU 50GB 3个月
推荐场景:
云数据库 RDS SQL Server,独享型 2核4GB
简介: SQL Server聚类数据挖掘信用卡客户可视化分析

全文链接:http://tecdat.cn/?p=30925


近年来商业银行利用先进数据挖掘技术对信用卡客户进行分类,区分不同的客户群体,然后针对不同客户群体,采取不同的发卡方式,营销策略,风险控制措施点击文末“阅读原文”获取完整代码数据


这些举动都是十分有必要的,也是对信用卡产品获得市场份额有巨大帮助作用的。

在信用卡分析时,我们向客户演示了用SQL Server的数据挖掘算法可以提供的内容。

查看数据

查看信用卡资料库:

5WK0L2{TN]N}R(Y42LG2JTI.png

变量信息:

AVB(IUG%RDB{IBV%NGI7PO6.png

导入数据库

数据导入数据库中。

CF147)AG6U[{6KTTKKN3Z)W.png

R$5YG9`IVZQC0OJE{R2L`%G.png

0(ICHAYNQ]9QA72P3HK`TFP.png

`IXZ)YGP[0~@1$JH_)FS]OP.png

数据挖掘

(1) 打开visual studio ,新建项目,选择商业智能项目,analysis services项目

`]$%FXOLZ{4K7_RPV)UGJIU.png

(2) 在解决方案资源管理器中,右键单击数据源,选择新建数据源

(3)数据源名称保持默认,完成

选择聚类,继续下一步

~KDI794$0SY[4ZV05WKE(ZE.png

相关视频

JA8Q)`S]R5JCMGA8W)OCG_5.png

关闭处理窗口后,就可在挖掘模型查看器看到系统经过分析得出的结果和文件:

SWV%$XU(2U$TVFRX[S3VRHW.png

 从聚类结果可以看到,聚类将所有用户分成了10个信用级别。

WK20EYYM8G)7}5QI4T9VDIF.png

从不同类别的依赖图可以看到,类别10、7、9、5之间具有较强的相关关系。说明这几个类别中的信用级别是类似的。下面可以具体看下每个类别中的各个属性的分布的比例。

`%]6U%)TKQ82CV)G)0E(Y8X.png

从上图可以看到不同类别的呆账比例是不同的。

从结果来看,相对来说,第7、10类别的呆账比例最小的,其他几个类别中呆账比例较高,因此可以认为这些类别中的用户的信用级别较高。同时可以看到这些类别的其他信息,这类用户的月开销较低,大多在10000元以下。同时可以看到,这类用户大多是都是都市用户,较少的城镇用户,说明都市用户的信用等级相对城镇用户的信用等级较高。另一方面,可以看到呆账用户中 ,有大部分是高收入人群,而低收入用户的呆账比例反而较低,可以认为低收入用户的信用等级反而较高。

BR{]2VK97O@[4PE~%Y61_D8.png

从每个类别的倾向程度来看,月开销较低的用户呆账比例较低。从另一方面来看,月收入较低的用户,倾向于是分类10的用户,也就是它们的信用等级较好。同时可以看到,户籍为都市的用户倾向于分类10的用户,而户籍为城镇的用户倾向于其他分类。说明都市用户的信用等级相对较高。同时,可以看到与收入越高的用户,更倾向于非10类别,因此,可以认为,收入越高的用户,越存在信用风险。

相关实践学习
使用SQL语句管理索引
本次实验主要介绍如何在RDS-SQLServer数据库中,使用SQL语句管理索引。
SQL Server on Linux入门教程
SQL Server数据库一直只提供Windows下的版本。2016年微软宣布推出可运行在Linux系统下的SQL Server数据库,该版本目前还是早期预览版本。本课程主要介绍SQLServer On Linux的基本知识。 相关的阿里云产品:云数据库RDS SQL Server版 RDS SQL Server不仅拥有高可用架构和任意时间点的数据恢复功能,强力支撑各种企业应用,同时也包含了微软的License费用,减少额外支出。 了解产品详情: https://www.aliyun.com/product/rds/sqlserver
相关文章
|
1月前
|
数据采集 机器学习/深度学习 数据可视化
数据挖掘实战:Python在金融数据分析中的应用案例
Python在金融数据分析中扮演关键角色,用于预测市场趋势和风险管理。本文通过案例展示了使用Python库(如pandas、numpy、matplotlib等)进行数据获取、清洗、分析和建立预测模型,例如计算苹果公司(AAPL)股票的简单移动平均线,以展示基本流程。此示例为更复杂的金融建模奠定了基础。【6月更文挑战第13天】
226 3
|
1月前
|
机器学习/深度学习 数据采集 算法
数据科学基础:数据挖掘与分析的技术探讨
【6月更文挑战第15天】本文探讨数据科学中的数据挖掘与分析技术,阐述其基础理论,包括数据预处理、探索和模型建立,并介绍统计分析、机器学习、深度学习等方法。面对数据质量、算法选择等挑战,数据挖掘在智能决策、个性化服务、预测等方面展现广阔前景,将在跨领域融合中发挥更大作用,同时也需关注隐私安全与技术伦理。
|
1月前
|
SQL 缓存 关系型数据库
✅分析SQL执行计划,我们需要关注哪些重要信息
SQL执行计划解析:12个关键字段详解,包括id(操作标识)、select_type(操作类型)、table(涉及表)、partitions(分区)、type(索引类型)、possible_keys(可能的索引)、key(使用索引)、key_len(索引长度)、ref(比较对象)、rows(扫描行数)、filtered(过滤比例)和Extra(额外信息)。类型从优至劣:system>const>eq_ref>ref>range>index>ALL。
|
18天前
|
SQL 存储 大数据
SQL中DISTINCT关键字的使用与性能影响分析
SQL中DISTINCT关键字的使用与性能影响分析
|
2月前
|
SQL HIVE UED
【Hive SQL 每日一题】分析电商平台的用户行为和订单数据
作为一名数据分析师,你需要分析电商平台的用户行为和订单数据。你有三张表:`users`(用户信息),`orders`(订单信息)和`order_items`(订单商品信息)。任务包括计算用户总订单金额和数量,按月统计订单,找出最常购买的商品,找到平均每月最高订单金额和数量的用户,以及分析高消费用户群体的年龄和性别分布。通过SQL查询,你可以实现这些分析,例如使用`GROUP BY`、`JOIN`和窗口函数来排序和排名。
|
2月前
|
SQL 分布式计算 数据可视化
数据分享|Python、Spark SQL、MapReduce决策树、回归对车祸发生率影响因素可视化分析
数据分享|Python、Spark SQL、MapReduce决策树、回归对车祸发生率影响因素可视化分析
|
2月前
|
算法 数据挖掘 数据库
R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享
R语言主成分PCA、决策树、boost预警模型在跨区域犯罪研究数据挖掘分析|数据分享
|
2月前
|
SQL 机器学习/深度学习 数据采集
数据分享|SQL Server、Visual Studio、tableau对信贷风险数据ETL分析、数据立方体构建可视化
数据分享|SQL Server、Visual Studio、tableau对信贷风险数据ETL分析、数据立方体构建可视化
|
2月前
|
数据可视化 数据挖掘
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分(下)
数据分享|R语言IMDb TOP250电影特征数据挖掘可视化分析受众偏好、排名、投票、评分
|
4天前
|
SQL Oracle 关系型数据库
MySQL、SQL Server和Oracle数据库安装部署教程
数据库的安装部署教程因不同的数据库管理系统(DBMS)而异,以下将以MySQL、SQL Server和Oracle为例,分别概述其安装部署的基本步骤。请注意,由于软件版本和操作系统的不同,具体步骤可能会有所变化。
24 3