使用 PolarDB 开源版 采用array数组和gin索引高效率解决用户画像、实时精准营销类业务需求

本文涉及的产品
云原生数据库 PolarDB MySQL 版,通用型 2核8GB 50GB
云原生数据库 PolarDB PostgreSQL 版,标准版 2核4GB 50GB
简介: PolarDB 的云原生存算分离架构, 具备低廉的数据存储、高效扩展弹性、高速多机并行计算能力、高速数据搜索和处理; PolarDB与计算算法结合, 将实现双剑合璧, 推动业务数据的价值产出, 将数据变成生产力. 本文将介绍使用 PolarDB 开源版高效率解决用户画像、实时精准营销类业务需求

背景

PolarDB 的云原生存算分离架构, 具备低廉的数据存储、高效扩展弹性、高速多机并行计算能力、高速数据搜索和处理; PolarDB与计算算法结合, 将实现双剑合璧, 推动业务数据的价值产出, 将数据变成生产力.

本文将介绍使用 PolarDB 开源版高效率解决用户画像、实时精准营销类业务需求

测试环境为macOS+docker, PolarDB部署请参考下文:

原理

1、场景介绍:

用户画像通常被用于精准营销场景, 根据用户的行为分析并给用户打标签, 充分了解用户属性的诉求可以更好的实现供需连, 例如推送用户之所需, 根据市场需求进行备货等等.

数据分析时解决供需问题, 节省社会成本, 提升社会效率的有力手段.

2、难点:

  • 标签多, 标签的多少动态增减, 需要大量DDL, 不适合大宽表
  • 标签过滤需要全表扫描, 非常慢
  • 标签组合(包含、不包含等等), 过滤效率低
  • 每个用户的标签数量可能不一样, 不适合结构化存储

3、PolarDB如何解决这个问题:

  • 画像存储: 采用数组, 解决了动态增减标签, 个性化标签的需求, 不涉及结构变更.
  • GIN索引: 解决高效率组合搜索过滤问题
  • fast update: 解决实时打标的效率问题. (后台异步merge gin index)

场景模拟和架构设计实践

1、创建模拟生成标签的函数

create or replace function gen_arr(normal int, hot int) returns int[] as $$  
  select array(select (100000*random())::int+500 from generate_series(1,$1)) || array(select (500*random())::int from generate_series(1,$2));  
$$ language sql strict;  

体现个性标签+热门标签, 个性标签10万个, 热门标签500个.

例如20个个性标签+10个热门标签, 组成了某个人的画像.

postgres=# select gen_arr(22,10);  
                                                                                 gen_arr                                                                                    
--------------------------------------------------------------------------------------------------------------------------------------------------------------------------  
 {84735,45437,35238,71110,22339,86790,89232,8340,851,50577,6600,53760,63854,95377,28505,12781,34180,56262,10835,53417,42865,67843,235,401,265,372,304,132,309,140,38,254}  
(1 row)  

2、创建测试表, 生产500万用户画像数据, 并创建gin索引

create table tbl (uid int8, tag int[]);  
  
insert into tbl select uid, gen_arr(22,10) from generate_series(1,5000000) uid;  
  
create index on tbl using gin (tag);  

3、圈选用户测试, 使用GIN倒排索引.

postgres=# explain select count(*) from tbl where tag @> '{100}'::int[];  
                                      QUERY PLAN                                        
--------------------------------------------------------------------------------------  
 Aggregate  (cost=24422.02..24422.03 rows=1 width=8)  
   ->  Bitmap Heap Scan on tbl  (cost=210.25..24359.52 rows=25000 width=0)  
         Recheck Cond: (tag @> '{100}'::integer[])  
         ->  Bitmap Index Scan on tbl_tag_idx  (cost=0.00..204.00 rows=25000 width=0)  
               Index Cond: (tag @> '{100}'::integer[])  
(5 rows)  

圈选某个热门标签

postgres=# select count(*) from tbl where tag @> '{100}'::int[];  
 count   
-------  
 99427  
(1 row)  
  
Time: 693.697 ms  

圈选某些热门标签

postgres=# select count(*) from tbl where tag @> '{100,50}'::int[];  
 count   
-------  
  1841  
(1 row)  
  
Time: 19.100 ms  

圈选某个个性标签

postgres=# select count(*) from tbl where tag @> '{600}'::int[];  
 count   
-------  
  1042  
(1 row)  
  
Time: 69.772 ms  

圈选某些个性标签

postgres=# select count(*) from tbl where tag @> '{600,700}'::int[];  
 count   
-------  
     0  
(1 row)  
  
Time: 11.029 ms  
  
postgres=# select count(*) from tbl where tag @> '{600,680}'::int[];  
 count   
-------  
     0  
(1 row)  
  
Time: 1.050 ms  

圈选某个个性标签, 并排除某个热门标签

postgres=# explain select count(*) from tbl where tag @> '{600}'::int[] and not (tag @> '{60}'::int[]);  
                                      QUERY PLAN                                        
--------------------------------------------------------------------------------------  
 Aggregate  (cost=23537.17..23537.18 rows=1 width=8)  
   ->  Bitmap Heap Scan on tbl  (cost=200.64..23478.51 rows=23463 width=0)  
         Recheck Cond: (tag @> '{600}'::integer[])  
         Filter: (NOT (tag @> '{60}'::integer[]))  
         ->  Bitmap Index Scan on tbl_tag_idx  (cost=0.00..194.78 rows=23917 width=0)  
               Index Cond: (tag @> '{600}'::integer[])  
(6 rows)  
  
Time: 0.570 ms  
  
postgres=# select count(*) from tbl where tag @> '{600}'::int[] and not (tag @> '{60}'::int[]);  
 count   
-------  
  1018  
(1 row)  
  
Time: 3.715 ms  

圈选某个热门标签, 并排除某个个性标签

postgres=# explain select count(*) from tbl where tag @> '{60}'::int[] and not (tag @> '{600}'::int[]);  
                                      QUERY PLAN                                        
--------------------------------------------------------------------------------------  
 Aggregate  (cost=109198.79..109198.80 rows=1 width=8)  
   ->  Bitmap Heap Scan on tbl  (cost=778.85..108962.84 rows=94380 width=0)  
         Recheck Cond: (tag @> '{60}'::integer[])  
         Filter: (NOT (tag @> '{600}'::integer[]))  
         ->  Bitmap Index Scan on tbl_tag_idx  (cost=0.00..755.26 rows=94834 width=0)  
               Index Cond: (tag @> '{60}'::integer[])  
(6 rows)  
  
Time: 1.714 ms  
  
postgres=# select count(*) from tbl where tag @> '{60}'::int[] and not (tag @> '{600}'::int[]);  
 count   
-------  
 98930  
(1 row)  
  
Time: 693.436 ms  

在笔记本上, 性能已经起飞, 何况是高端机器?

相关实践学习
使用PolarDB和ECS搭建门户网站
本场景主要介绍基于PolarDB和ECS实现搭建门户网站。
阿里云数据库产品家族及特性
阿里云智能数据库产品团队一直致力于不断健全产品体系,提升产品性能,打磨产品功能,从而帮助客户实现更加极致的弹性能力、具备更强的扩展能力、并利用云设施进一步降低企业成本。以云原生+分布式为核心技术抓手,打造以自研的在线事务型(OLTP)数据库Polar DB和在线分析型(OLAP)数据库Analytic DB为代表的新一代企业级云原生数据库产品体系, 结合NoSQL数据库、数据库生态工具、云原生智能化数据库管控平台,为阿里巴巴经济体以及各个行业的企业客户和开发者提供从公共云到混合云再到私有云的完整解决方案,提供基于云基础设施进行数据从处理、到存储、再到计算与分析的一体化解决方案。本节课带你了解阿里云数据库产品家族及特性。
目录
相关文章
|
6天前
|
搜索推荐 关系型数据库 分布式数据库
PolarDB 开源基础教程系列 7.3 应用实践之 精准营销场景
本文介绍了基于用户画像的精准营销技术,重点探讨了如何通过标签组合快速圈选目标人群。实验分为三部分: 1. **传统方法**:使用字符串存储标签并进行模糊查询,但性能较差,每次请求都需要扫描全表。 2. **实验1**:引入`pg_trgm`插件和GIN索引,显著提升了单个模糊查询条件的性能。 3. **实验2**:改用数组类型存储标签,并结合GIN索引加速包含查询,性能进一步提升。 4. **实验3**:利用`smlar`插件实现近似度过滤,支持按标签重合数量或比例筛选。
26 3
|
7月前
|
存储
数据存储之数组的特点,长度固定,适应变化需求,集合类特点是空间可变,ArrayList泛型,ArrayList<String> array = new ArrayList<String>()
数据存储之数组的特点,长度固定,适应变化需求,集合类特点是空间可变,ArrayList泛型,ArrayList<String> array = new ArrayList<String>()
|
7月前
|
前端开发
网页设计02网站的九大类型分类,营销,咨询门户类网站,代表新浪
网页设计02网站的九大类型分类,营销,咨询门户类网站,代表新浪
|
9月前
|
搜索推荐 API 数据库
开源电子邮件营销平台 listmonk 使用教程
电子邮件营销是海外产品推广的关键,而ESP(电子邮件服务提供商)如Mailchimp和SendCloud等常被用于管理邮件列表和跟踪效果。然而,成本和定制化限制成为问题。为解决这些问题,开源平台如listmonk提供了一种灵活且可定制的解决方案。listmonk用Go语言编写,具备订阅者管理、邮件创建发送、跟踪分析和API集成等功能,特别适合中小企业和大型组织。它还支持一键部署,例如通过Sealos应用商店,使得部署过程变得简单。
317 1
|
9月前
|
分布式计算 搜索推荐 算法
用户画像系列——Lookalike在营销圈选扩量中的应用
用户画像系列——Lookalike在营销圈选扩量中的应用
261 0
|
关系型数据库 分布式数据库 PolarDB
沉浸式学习PostgreSQL|PolarDB 15: 企业ERP软件、网站、分析型业务场景、营销场景人群圈选, 任意字段组合条件数据筛选
本篇文章目标学习如何快速在任意字段组合条件输入搜索到满足条件的数据.
657 0
|
测试技术
[Eigen中文文档] Array类与元素操作
与Matrix类用于线性代数计算不同的是,Array类提供了通用目的数组。此外,Array类提供了一种执行按系数运算的简单方法,这可能没有线性代数意义,例如对每一个元素都加一个常数或按系数将两个数组相乘。
283 0
|
搜索推荐 关系型数据库 数据库
沉浸式学习PostgreSQL|PolarDB 3: 营销场景, 根据用户画像的相似度进行目标人群圈选, 实现精准营销
业务场景1 介绍: 营销场景, 根据用户画像的相似度进行目标人群圈选, 实现精准营销 在营销场景中, 通常会对用户的属性、行为等数据进行统计分析, 生成用户的标签, 也就是常说的用户画像. 标签举例: 男性、女性、年轻人、大学生、90后、司机、白领、健身达人、博士、技术达人、科技产品爱好者、2胎妈妈、老师、浙江省、15天内逛过手机电商店铺、... ... 有了用户画像, 在营销场景中一个重要的营销手段是根据条件选中目标人群, 进行精准营销. 例如圈选出包含这些标签的人群: 白领、科技产品爱好者、浙江省、技术达人、15天内逛过手机电商店铺 .
338 0
|
Java 索引
【重学Javase】—— 数组(从头剖析一维数组,二维数组,array常用工具类以及数组的两种常见异常)
【重学Javase】—— 数组(从头剖析一维数组,二维数组,array常用工具类以及数组的两种常见异常)
160 0
【重学Javase】—— 数组(从头剖析一维数组,二维数组,array常用工具类以及数组的两种常见异常)
|
9月前
|
搜索推荐 关系型数据库 分布式数据库
使用 PolarDB 开源版 采用array数组和gin索引高效率解决用户画像、实时精准营销类业务需求
背景PolarDB 的云原生存算分离架构, 具备低廉的数据存储、高效扩展弹性、高速多机并行计算能力、高速数据搜索和处理; PolarDB与计算算法结合, 将实现双剑合璧, 推动业务数据的价值产出, 将数据变成生产力.本文将介绍使用 PolarDB 开源版高效率解决用户画像、实时精准营销类业务需求测试...
129 0

相关产品

  • 云原生数据库 PolarDB