使用MaxCompute进行网贷业务风控预测分析

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

摘要:网络借贷指在网上实现借贷,借入者和借出者均可利用这个网络平台,实现借贷的“在线交易”。网络借贷分为b2c和c2c模式。一切认证、记账、清算和交割等流程均通过网络完成,借贷双方足不出户即可实现借贷目的,而且一般额度都不高,无抵押,纯属信用借贷。网络借贷的风险不言而喻,构建一个准确率高的风控系统显得格外重要,现在我们利用某网络贷款网站提供的几年来贷款风险数据(经过脱敏处理),使用机器学习的方法构造一个能准确从借款人的资料中判断其违约的可能性(借钱不还)。

数据信息:
包括信用违约标签(因变量,违约或者不违约)
建模所需的基础与加工字段(自变量)
相关用户的网络行为原始数据
本着保护借款人隐私的目的,数据字段已经经过脱敏处理。
screenshot
Master表(每一行代表一个成功成交借款样本,每一个样本包含200多个各类字段)
screenshot
Log_Info(借款人的登录信息)
screenshot
Userupdate_Info(借款⼈修改信息)

一、违约评估架构
1.​数据源:数据包括某借贷网站提供的借款人资料以及是否按时还款等情况构成的记录,一共3万条记录;
2.数据同步至阿里云:使用DataX工具将数据导入到在ODPS建立的表中;
3.流程计算:阿里云构建算法分析流程
4.分析结果:对计算出的违约风险储存于表中;
5.数据可视化展示:从数据库中读取数据进行可视化展示。

二、分析方法
screenshot
1.本文中的3万记录来之于国内某网络借贷平台的经过脱敏处理的真实借贷风险数据。
2.获得的数据导入阿里云数加平台,数据表包含有每一笔借款的借款时间、借款人籍贯、借款人学历、借款人社交信息、借款人是否按期还款等等一些字段。
3.在数加的算法平台上建立回归预测的算法流程如上图。
4.采用数加组件的缺失值统计,对每一借款人资料的缺失比例进行统计,对比其在训练集和测试集上缺失比例的分布情况,剔除那些资料缺失异常的记录;统计每个数值型字段的标准差,剔除掉标准差几乎为零的字段,这些字段对结果的区分度几乎为零;
1)剔除异常值(横坐标为每一个贷款人,纵坐标为每一个贷款人信息的缺失字段的个数;左边为训练集中,右边为测试集中)
screenshot
2)剔除标准差为几乎零的特征(以小于0.1作为剔除的阈值)
screenshot
5.从信息中构造特征
1)分开统计出贷款违约的借款人和正常还款的借款人在每天的成交数量,从中可以看出两者的分布不一样,故看出时间对借款人是否正常还款存在区别性,所以从成交时间中提取出月份日期信息;
2)每天的成交数量与是否履约的分布情况(count_1:贷款违约,count_0正常还款)
screenshot
3)将借款人的籍贯信息利用城市等级进行分类合并;或者将借款人所在城市信息作为每一个人借款人的特征放入xgboost中进行训练学习,得到每一个城市的重要度排名,提取出重要度最高的前40个单独作为一类城市,其他的城市进行合并为同一类;
4)从提供的登录信息中提取每个借款人的登录信息计算出其平均登录间隔,借款后多少天才会登录等等一些组合特征;
5)将类别型特征使用独热向量编码;
6)最后将数值型的字段进行标准化,既能加快模型的训练速度,也能将数据放入一个标准分布内,使每个特征之间的数值大小差距尽可能小。
6.将处理完毕的数据分别放入logistics regression、随机森林,xgboost中进行分类学习,并用网格搜索各分类器达到最佳状态。
7.可视化展示,将流程计算的结果,进行可视化展示。

三、违约评估预测结果展示
我们分别在尝试在logistics regression、随机森林、xgboost上进行模型训练并进行预测
1.在logistics regression上,利用5折交叉验证,将参数正则化惩罚项‘C’设置为0.4,正则化选择L1正则,在验证集上9000个样本上进行预测,AUC的值达到了0.72993。
screenshot
2.在随机森林上,利用5折交叉验证,将决策树的个数设置为100,决策树最大深度设置为13,决策树一个节点所需要用来分裂的最小样本数设置为160,在验证集上9000个样本上进行预测,AUC的值达到了0.720267。
screenshot
3.在xgboost上,利用5折交叉验证,将增强树的数量设置为113颗,决策树最大树深设置为3,最小业主节点样本权重和设置为5,在验证集上9000个样本上进行预测,AUC的值达到了0.751830。
screenshot

                                             MaxCompute最佳实践
AI 代码解读
相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
打赏
0
0
0
0
78881
分享
相关文章
MySQL · 引擎特性 · 像NOSQL那样使用MySQL
前言 最近Release的MySQL5.7.12增加了新的协议支持,通过X Plugin实现,同时增加了新的客户端API,开发者可以通过API来把MySQL作为document store的服务端,可以完成和MongoDB类似的document操作,例如支持CRUD等操作,但底层存储依然支持传统数
9816 0
PostgreSQL GUI pgadmin4 v3.3 支持 gis geometry 数据编辑、显示
标签 PostgreSQL , pgadmin , gis , 编辑 背景 pgadmin 4 v3.3 开始支持geometry 类型的展示。 https://www.postgresql.org/ftp/pgadmin/pgadmin4/v3.3/windows/ 如果geometry使用的是SRID 4326 (WGS 84 lon/lat)坐标系,则pgadmin会自动从OpenStreetMap 加载图层,作为背景。
2180 0
|
11月前
|
std::atomic 相关接口(来自cppreference.com)
std::atomic 相关接口(来自cppreference.com)
107 0
基于springboot的校园二手交易平台(程序+数据库+文档)
基于springboot的校园二手交易平台(程序+数据库+文档)
MySQL中查询中位数?
计算中位数可能是小学的内容,然而在数据库查询中实现却并不是一件容易的事。我们今天就来看看都有哪些方法可以实现。
635 0
MySQL中查询中位数?
深度探索自适应学习率调整:从传统方法到深度学习优化器
【5月更文挑战第15天】 在深度学习的复杂网络结构与海量数据中,学习率作为模型训练的关键超参数,其调整策略直接影响着模型的收敛速度与最终性能。传统的学习率调整方法,如固定学习率、学习率衰减等,虽然简单易行,但在多样化的任务面前往往显得力不从心。近年来,随着自适应学习率技术的兴起,一系列创新的优化器如Adam、RMSProp和Adagrad等应运而生,它们通过引入自适应机制动态调整学习率,显著改善了模型的训练效率与泛化能力。本文将深入剖析传统学习率调整方法的原理与局限性,并详细介绍当前主流的自适应学习率优化器,最后探讨未来可能的发展方向。
MaxCompute SQL使用小技巧之时间日期处理
业务需求分析中经常会对时间日期进行处理,MaxComputer中也有很多关于日期的处理函数,文章就是对这些内置函数相互嵌套使用达到分析要求的分析
5115 0
系列文章:Kubernetes中日志的正确输出姿势
上一期主要和大家介绍从全局维度考虑如何去构建K8s中的日志系统,本期我们从实践角度出发来一步步构建K8s中的日志监控体系。构建日志系统的第一步是如何去产生这些日志,而这也往往是最繁杂最困难的一步。
5212 0

热门文章

最新文章