基于关系的违规团伙发掘风控方案

简介: 目前很多平台方都有团伙作案的情况发生,比如团伙性薅羊毛,比如团伙性的制造一些虚假信息,团伙性发送违法广告。之所以是团伙性作案,因为作案人员之间有某种关系连接。当业务方获取了人员关系之后,能否成功挖掘出违规团伙,关系到平台的安全。

业务背景

目前很多平台方都有团伙作案的情况发生,比如团伙性薅羊毛,比如团伙性的制造一些虚假信息,团伙性发送违法广告。之所以是团伙性作案,因为作案人员之间有某种关系连接。当业务方获取了人员关系之后,能否成功挖掘出违规团伙,关系到平台的安全。

业务痛点

绝大部分客户可以通过SNS留言、转账、通话等数据构建出用户关系网络,并且可以甄别出网络中部分违规客户,缺乏有效的智能化的方案对全网所有客户进行是否违规的判断。

解决方案

PAI平台提供了一套基于关系图挖掘的的算法,包含标签传播、最大联通子图等经典图算法

1.人力要求:需要具备基础的图挖掘算法背景、懂得关系型数据的构建模式

2.开发周期:1-2天

3.数据要求:可以将数据构建成点边点的模式,点指的是每个用户,边指的是某种关系(关系可以是通话、转账、留言等等)

数据说明

下图是已知的一份人物通联关系图,每两个人之间的连线表示两人有一定关系,可以是同事或者亲人关系等。已知“Enoch”是信用用户,“Evan”是欺诈用户。需要通过图算法,计算出其它人的信用指数,即得到图中每个人是欺诈用户的概率。这个数据可以方便相关机构做风控。

)

上图对应的数据集如下,上图是个有向图,每个点代表一个人,每个人都是一个start_point,每个start_point都连接一个end_point。count表示start_point和end_point的连线,count值越大说明start_point和end_point这两个人的关系越密切。

特征数据:

参数名称 参数描述
start_point 用户A,每个关系连线的起点
end_point 用户B,每个关系连线的终点
count 用户A和用户B的关系程度

流程说明

进入PAI-Studio产品:https://pai.data.aliyun.com/console

该方案数据和实验环境已经内置于首页模板:

打开实验:

1. 最大联通子图

最大联通子图的功能:图算法的输入数据是关系图谱结构的,最大联通子图可以找到有通联关系的最大集合,在团伙发现的场景中可以排除掉一些与风控场景无关的人。
本次实验通过最大联通子图组件将数据中的群体分为两部分,并赋予group_id。通过SQL脚本组件和JOIN组件去除下图中的无关联人员。

2. 单源最短路径

通过单源最短路径组件探查出每个人的一度人脉、二度人脉等关系。“distance”表示“Enoch”通过几个人可以联络到目标人,如下图所示:

3. 标签传播分类

标签传播分类算法为半监督的分类算法,原理是用已标记节点的标签信息去预测未标记节点的标签信息。在算法执行过程中,每个节点的标签按相似度传播给相邻节点。
使用标签传播分类组件除了需要所有人员的通联图数据以外,还要有人员打标数据。本实验通过已知数据(读数据表)组件导入打标数据(“weight”表示目标是欺诈用户的概率),如下图所示:

4. 结论

通过SQL脚本组件对结果进行筛选,最终展现的是每个人涉嫌欺诈的概率,数值越大表示是欺诈用户的概率越大,如下图所示:

总结

通过PAI-Studio内置的基于关系的违规团伙发掘方案可以基于用户的关系网络自动识别出全网每个用户的风险值,做到违规团伙智能化挖掘的作用,常被应用到金融、社交、电信等行业。

相关实践学习
机器学习概览及常见算法
机器学习(Machine Learning, ML)是人工智能的核心,专门研究计算机怎样模拟或实现人类的学习行为,以获取新的知识或技能,重新组织已有的知识结构使之不断改善自身的性能,它是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域。 本课程将带你入门机器学习,掌握机器学习的概念和常用的算法。
目录
相关文章
什么是三极管?
一、什么是三极管 三极管(Transistor)是一种电子器件,由三个控制电极组成,分别是基极(Base)、发射极(Emitter)和集电极(Collector)。它是一种半导体器件,常用于放大、开关和稳压等电路中。 三极管可以根据其结构和材料分为两种类型:NPN型和PNP型。NPN型三极管的基极为P型材料,发射极为N型材料,集电极为P型材料;PNP型三极管的基极为N型材料,发射极为P型材料,集电极为N型材料。 三极管的工作原理是通过控制基极电流来控制发射极和集电极之间的电流。当基极电流较小时,三极管处于截止状态,发射极和集电极之间几乎没有电流流动;当基极电流逐渐增大时,三极管进入饱和状态,发
1115 0
|
机器学习/深度学习 存储
卡方分箱、KS分箱、最优IV分箱、树结构分箱、自定义分箱
卡方分箱、KS分箱、最优IV分箱、树结构分箱、自定义分箱
4051 0
卡方分箱、KS分箱、最优IV分箱、树结构分箱、自定义分箱
|
机器学习/深度学习 数据采集 人工智能
快瞳AI鱼类识别 —— AI赋能海洋生物智能监测
鱼类AI识别技术基于深度学习算法,通过大量鱼类图像训练,实现对鱼类的快速精准识别。该技术模仿人类视觉系统,利用卷积神经网络(CNN)提取鱼体特征,从浅层的鳞片纹理到深层的整体形态逐步分析。快瞳科技提出的MF-Net模型突破了鱼类种类繁多、数据不均衡等难点,通过多阶段特征融合、动态权重调整及三维特征建模,显著提升识别性能。这项技术不仅重塑水产科研方式,还为海洋生物多样性保护提供智能化解决方案,推动AI在生态保护领域的应用迈入新阶段。
1656 6
|
12月前
|
存储 数据采集 人工智能
StarRocks:Connect Data Analytics with the World
本文基于镜舟科技 CTO、StarRocks TSC 成员张友东在 StarRocks Connect 2025 活动上的主题分享整理而成。围绕大会的核心主题——“数据与世界的连接”,本文将从三个维度进行阐述: • 过去:StarRocks 通过开源的力量,将全球的社区用户紧密联系在一起。 • 现在:StarRocks 正在推动数据与现代化数据分析应用的融合。 • 未来:StarRocks 将进一步探索数据分析与 AI Agent 的结合。
|
存储 算法 NoSQL
千亿级向量索引的秘密武器:一文详解蚂蚁集团的工程实践和开源突破
本文整理自2025QCon全球软件大会贾玮(蚂蚁集团NoSQL数据库和向量数据库的技术负责人)的演讲实录。 本文围绕向量检索技术的研究与实践展开系统性阐述,包含以下四个维度: 1.向量检索的基础原理以及相关的核心技术挑战; 2.蚂蚁集团在向量检索领域的工程实践和具体案例; 3.向量检索领域的最新学术研究和应用成果; 4.蚂蚁开源向量索引库VSAG的最新进展。
|
机器学习/深度学习 运维 搜索推荐
机器学习中准确率、精确率、召回率、误报率、漏报率、F1-Score、AP&mAP、AUC、MAE、MAPE、MSE、RMSE、R-Squared等指标的定义和说明
在机器学习和深度学习用于异常检测(Anomaly detection)、电子商务(E-commerce)、信息检索(Information retrieval, IR)等领域任务(Task)中,有很多的指标来判断机器学习和深度学习效果的好坏。这些指标有相互权衡的,有相互背向的,所以往往需要根据实际的任务和场景来选择衡量指标。本篇博文对这些指标进行一个梳理。
机器学习中准确率、精确率、召回率、误报率、漏报率、F1-Score、AP&mAP、AUC、MAE、MAPE、MSE、RMSE、R-Squared等指标的定义和说明
|
网络协议 程序员 UED
如何确保单聊消息100%送达?揭秘消息可靠传输的核心机制!
哈喽,大家好!我是技术好朋友小米,今天聊聊单聊消息的可靠传输。通过TCP的超时、重传、确认机制,结合去重和离线消息优化,我们可以设计出高效、可靠的消息传输系统。希望今天的分享能给大家带来帮助!如果有问题,欢迎留言交流。
614 1
如何确保单聊消息100%送达?揭秘消息可靠传输的核心机制!
|
SQL 数据库 数据库管理
逆天了!IDEA执行大文件SQL,效率甩 Navicat 几条街?
【10月更文挑战第1天】在数据库管理和开发领域,SQL文件的执行效率是衡量数据库管理工具性能的重要指标之一。近期,IDEA(IntelliJ IDEA)在执行大文件SQL方面的表现引起了广泛关注,其效率远超传统的数据库管理工具Navicat。本文将深入探讨这一现象背后的原因,并结合工作学习中的技术干货,为大家带来一些实用的建议和技巧。
706 1
|
算法 安全 物联网
什么是ECC?ECC 和 RSA 之间有何区别?
什么是ECC?ECC 和 RSA 之间有何区别?
3650 1

热门文章

最新文章