Polars实践(2):阿里天池——淘宝用户购物行为分析

简介: Polars实践(2):阿里天池——淘宝用户购物行为分析

本期,我们继续使用Polars来对阿里天池数据集——淘宝用户行为进行分析。一、用户行为分析总览本节主要用Polars来看一下,在行为类型这一列中,4种行为的占比分别是多少?(pv 商品详情页pv,等价于点击;buy 商品购买;cart将商品加入购物车;fav 收藏商品)Polars实现代码如下:

df_type=df1.group_by('行为类型').len()df_type

ce181ddd2319ebdfe811ee33090147fd.png

用matplotlib画个饼图直观的看一下

import matplotlib.pyplot as pltplt.figure()plt.pie(df_type['len'], labels=df_type['行为类型'], autopct='%1.1f%%')plt.legend(df_type['行为类型'], loc="best")plt.show()

190957f6145df344cefe7a98c02b8fcb.png

可以看到,在整个数据集中,商品点击PV数量最多,购买行为数量占比最少。二、看看只进行了一次点击操作(PV)的用户

# 筛选出行为类型等于pv的行,即只有点击的用户filtered_df = df1.filter(pl.col("行为类型")=='pv')# 找出这些行中用户ID只进行了一次点击的客户。unique_group_values = filtered_df.group_by('用户ID').len().sort(by="len",descending=False)unique_group_values

c65bbb0e8ca99bf916a0795e28a4aeb3.png

#找出只进行了一次PV点击的用户fiopv=unique_group_values.filter(pl.col('len')==1)fiopv

a379e723e0b74502bcc570187faa0615.png

整个数据集中,共有666个用户只进行了一次点击PV操作。

三、统计哪个用户的用户行为最多

#统计每个用户ID在此期间进行了多少次行为类型操作bemax=df1.group_by('用户ID').agg(pl.col('行为类型').count())bemax

d65fdb5467fa316cb8546355523e2696.png

#排序,找出行为类型最小、最大的用户bemax.sort(by="行为类型",descending=False)

7c4c268471616a9858a9072152d5a7fb.png

用户ID为503757的用户在整个数据集中进行了848次操作,我们来看看他(她)到底都进行了哪些操作?

#筛选出最多行为类型的用户的数据,即用户ID为503757的用户
be5max=df1.filter(pl.col('用户ID')==503757)be5max

34935c582cba6265cc4d233deeecb6a6.png

来看看他(她)买东西(buy)的具体情况:

#看看操作最多的这位买家都买了些什么,都在什么时间买的be5max.filter(pl.col('行为类型')=='buy')

5f242823a1144c4b6e32d9acb5e283b0.png

这位买家集中在一天当中的10点进行操作,其中2017年12月1日同一时间一次购买了5件商品,看来是直接购物车买单结算了 本期就分析到这里,未完待续,敬请期待!

相关文章
|
算法 安全 数据安全/隐私保护
windows快捷键和常见操作
windows快捷键和常见操作
842 0
|
Java Maven
程序包org.springframework.transaction.annotation不存在
整合ssm报:程序包org.springframework.transaction.annotation不存在 使用注解: @Transactional 之后,就一直报不存在 最终找到原因是:maven依赖 spring-tx版本问题,换个版本就OK
2004 0
程序包org.springframework.transaction.annotation不存在
|
8月前
|
数据采集 自然语言处理 数据可视化
时序数据分析:Python爬取新浪财经频道新闻并绘制趋势图
时序数据分析:Python爬取新浪财经频道新闻并绘制趋势图
|
存储 数据采集 数据挖掘
Polars实践(4):阿里天池——淘宝用户购物行为分析
Polars实践(4):阿里天池——淘宝用户购物行为分析
827 1
|
机器学习/深度学习 人工智能 API
一篇说人话的文章,告诉你 Django、Flask、FastAPI 到底怎么选
Django 是功能齐全的“全家桶”,适合快速搭建完整应用;Flask 灵活轻量,适合小型项目与自定义开发;FastAPI 性能强劲,专为高并发与 API 设计。三者定位不同,适用场景各异,学习顺序建议:FastAPI → Django,提升开发效率与理解深度。
811 10
|
Kubernetes Cloud Native 区块链
Arista cEOS 4.30.10M - 针对云原生环境设计的容器化网络操作系统
Arista cEOS 4.30.10M - 针对云原生环境设计的容器化网络操作系统
460 0
|
数据挖掘 大数据 API
Polars实践(1):阿里天池——淘宝用户购物行为分析
Polars实践(1):阿里天池——淘宝用户购物行为分析
1267 0
|
数据采集 数据可视化 数据挖掘
学生成绩分析项目——数据分析与可视化
学生成绩分析项目——数据分析与可视化
1512 0
|
数据挖掘 Python
Pandas实战(1):电商购物用户行为数据分析
Pandas实战(1):电商购物用户行为数据分析
1202 1
|
并行计算 大数据 数据处理
亿级数据处理,Pandas的高效策略
在大数据时代,数据量的爆炸性增长对处理技术提出更高要求。本文介绍如何利用Python的Pandas库及其配套工具高效处理亿级数据集,包括:采用Dask进行并行计算,分块读取以减少内存占用,利用数据库进行复杂查询,使用内存映射优化Pandas性能,以及借助PySpark实现分布式数据处理。通过这些方法,亿级数据处理变得简单高效,助力我们更好地挖掘数据价值。
800 1