用户画像系列——推荐相关核心标签(偏好类)

简介: 用户画像系列——推荐相关核心标签(偏好类)

一、背景

我们经常在逛购物网站或者刷抖音、听网易云音乐的时候,会有猜你喜欢或者为你推荐这样一个功能,而这依赖的就是用户画像的偏好类标签:比如说明星偏好(喜欢某个明星或者歌手的作品)、类型偏好(比如说:喜欢美妆类、喜欢美食类)


二、偏好标签加工的核心逻辑

偏好类标签一般都是以用户的行为日志进行加工。

比如说:视频类软件(观影日志、评论日志、点赞日志、收藏日志)——内容偏好、类型偏好、明星偏好,电商类(订单日志、浏览日志、收藏日志、加购物日志)——商品偏好、价格偏好、品牌偏好

下面我们以视频类软件为例来详细讲解下偏好类标签的加工逻辑

1.偏好类事实型:主要是根据用户观影数据来计算用户在某个内容或者类型下的观影总时长和最后一次观影时间

上面是一张播放行为表,涵盖了基本的播放行为数据,和一张为tag维表(一个电视剧或者电影会打上非常多的标签,表中只是罗列了3个)

根据上述两张表可以生成如下用户观影tag表,能看到一个电视剧或者电影能很明显的

根据上述表进行计算得到每个用户在每个标签下的观影总时长,该标签下最后一次观影时间

select userid,content_tag,sum(play_time) as total_time,max(last_play_time) as last_play_time from dws_user_play_info_tag group by userid,content_tag

这样每个用户的内容偏好标签即可计算完成

注:当我们想看用户最近半年的观影偏好时,就用用户最近半年的观影数据来进行计算即可,这样就能动态产出用户观影偏好

细心的读者发现打在某个tag上有观影总时长和最后一次观影时间,观影总时长能看出这个用户对于这种tag的内容非常感兴趣,而最后一次观影时间说明最近用户在观看这部分内容。

相当于总时长代表的是一个长期兴趣,而最后一次观影代表的是用户的一个短期兴趣。比如说:用户男性经常观看古装或者美女,但是最近有一个毕竟火的热点视频,该用户也在观看,但这种只能代表用户最近一段时间的兴趣偏好,当过了这段时间就应该选用长期兴趣标签了。

2.偏好类权重型:主要是根据用户观影数据来计算用户在某个内容或者类型下的观影权重,比如说权重越高说明用户对于某个内容更感兴

用户观影权重表

INSERT OVERWRITE TABLE dws_user_play_weight_info PARTITION(dt='${current_date}')
select userid, id, sum(feature_value) as feature_value
from (
select
userid,   --用户id
id,    --电视剧或者电影id
exp(-1 * cast(datediff('${current_date}', dt) / 7 as int) * 7 / (28 * 3 / 2.0))
* 1.0 / ( 1.0 + exp(-0.01 * ( playtime - 400 ))) as weight
from dwd_user_play_info
where dt between '${current_date-28}' and '${current_date}'   ---28天一个周期
union all
-- 4周之前
select userid, id,
exp(-1 * 28 / (28 * 3 / 2.0))* weight as weight --衰减
from dws_user_play_weight_info
where dt='${current_date-29}'
)T2
group by userid, id
having sum(weight) > 0.001
distribute by userid;

注:权重公式系数非常有讲究,主要看是关注最后一次观影时间还是更加关注播放时长,如果更关注时长则时长权重更大,如果更加关注最后一次观音时间则此处系数应该更大。

归一化:直接按照视频id打上标签然后相加权重值明显会超过1,因此需要归一化处理

select userid, tag, weight
from (
select userid, id, weight, row_number() over(partition by userid order by weight desc) as rn
from (
select
userid,
id,
2 / ( 1 + exp(-0.5 * (sum(s1) + sum(s2)) )) - 1 as weight
from (
-- 2. 近期观影
select
A.account_id,
B.tag,
0 as s1,
A.weight * B.weight as s2,
1 as s3
from (
select id, tag, weight  ---weight都为1,后续可给标签加上权重代表该标签重要性较强
from dim_content_tag_info ---内容标签打平之后的表
)B
inner join (select * from dws_user_play_weight_info  ---用户观影权重表
where dt='${current_date}') A
on B.id =A.id
)T1
group by userid, tag
)T2
)T3
where rn <= 50 and weight > 0.01;

三、总结

至此即完成了偏好类标签的处理和加工,应用的话,可以在广告、推荐等多个场景进行应用。比如说:某个用户经常看搞笑视频可以给它推荐搞笑的玩具或者视频等等


相关实践学习
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
【涂鸦即艺术】基于云应用开发平台CAP部署AI实时生图绘板
相关文章
|
存储 SQL 分布式计算
用户画像系列—如何从0到1建设用户画像
用户画像系列—如何从0到1建设用户画像
550 0
|
存储 搜索推荐 关系型数据库
用户画像系列——HBase 在画像标签过期策略中的应用
用户画像系列——HBase 在画像标签过期策略中的应用
458 0
|
8月前
|
数据可视化 前端开发 数据挖掘
期货数据API对接与可视化分析全攻略:从数据获取到K线图生成
本文系统讲解期货数据API对接与K线图可视化全流程,涵盖WebSocket实时行情获取、RESTful历史数据调用、Pandas数据清洗处理及mplfinance、ECharts等多方案图表生成,助你构建完整的期货分析系统。
1926 11
|
11月前
|
机器学习/深度学习 数据采集 人工智能
Phi-3 技术报告:手机本地运行的高能力语言模型
Phi-3系列模型通过高质量数据训练与架构创新,实现小体积、高性能。38亿参数的phi-3-mini在手机端可达GPT-3.5水平,支持长上下文、多模态与高效推理,推动AI普惠化。
1066 1
|
9月前
|
人工智能 自然语言处理 开发者
周报不是流水账,这个AI指令帮你写出让老板点赞的工作汇报
一个帮助技术人快速生成专业工作周报的AI指令,通过结构化输入和价值导向表达,让你的周报从流水账变成让老板点赞的高质量汇报,15分钟搞定原本需要1小时的周报撰写。
2175 80
|
人工智能 编解码 自然语言处理
DreamActor-M1:字节跳动推出AI动画黑科技,静态照片秒变生动视频
DreamActor-M1是字节跳动研发的AI图像动画框架,通过混合引导机制实现高保真人物动画生成,支持多语言语音驱动和形状自适应功能。
1200 40
DreamActor-M1:字节跳动推出AI动画黑科技,静态照片秒变生动视频
|
11月前
|
数据采集 存储 机器学习/深度学习
数据融合是什么?进行数据融合的4大关键环节!
当业务数据分散、格式不一,难以统一分析时,数据融合成为关键。它通过整合多源数据,形成统一、高质量的数据集,为AI模型提供精准输入。本文详解数据融合的定义、类型、挑战及应对方法,助你打破数据壁垒,挖掘深层价值,推动业务创新。
数据融合是什么?进行数据融合的4大关键环节!
|
11月前
|
数据采集 数据库 索引
新闻网站的数据采集与更新思路
该方案设计了一个跨站点的增量更新引擎,用于高效采集央视新闻、中国新闻网和环球网等多源新闻数据。通过代理IP和内容哈希签名技术,实现新闻的新增与更新检测,大幅降低冗余抓取和带宽消耗。实验表明,该方法在多源新闻采集中具备高效性和实用性,可拓展为行业级舆情雷达系统,支持事件追踪与趋势分析。
1491 2
新闻网站的数据采集与更新思路
|
数据可视化 物联网 开发者
深度解析四大LLM微调工具:从单卡到千亿级训练的四大解决方案
本文详解大语言模型微调四大工具——Unsloth、Axolotl、LlamaFactory、DeepSpeed,覆盖从单卡实验到万亿参数分布式训练场景,助你掌握主流框架选型策略,提升微调效率。建议点赞收藏。
3699 1
|
12月前
|
JSON 监控 数据挖掘
抖音电商 API 接口:抖音平台电商活动热度实时监测
抖音电商API接口助力实时监测活动热度,支持商品销量、用户互动等数据获取,帮助商家优化营销策略,提升平台用户体验。
1038 0

热门文章

最新文章