美团生活服务个性化推荐实践

简介:

张彬(美团推荐算法高级研发工程师):2012年3月硕士毕业于北京邮电大学,有过两年的互联网广告工作经历,期间先后参与过user profile挖掘、实时竞价算法、ctr预估等多个核心项目,对RTB、DSP、DMP中的相关技术有较好的理解和认识,积累了丰富的经验。2013年初加入美团网,主要负责美团个性化推荐系统的构建和优化,通过完善召回算法和引入重排序模型等大幅度提高了系统的转化率。

美团作为全国领的本地生活服务平台,在本地生活服务推荐领域已经进行了一些探索,这个分享主要是对这些探索的一些总结。我们看到本地生活服务领域的推荐需要重度使用传统的推荐算法,同时也存在很强的特色。例如,在本地生活服务领域,商户的地理位置对用户的决策影响很大,针对这点我们做了大量基础工作。下面我们一同看下美团是如何实现个性化推荐的。

一、推荐美团的原因

1.活跃用户过亿,移动端交易占80%以上。

图1.美团移动交易占比逐年变化树状图

2.推荐方式:

◎推荐产品:10+推荐产品,每天服务 30M+ 用户

◎推荐形式:User2Items、Item2Items、Personal push、Others

◎推荐实体:

图2.美团推荐实体选用

◎推荐平台:Mobile、PC

◎其他方式:购买完成,评价完成,搜索无结果,附近团购,相关团购

 

 


图3.美团其他推荐方式

 

二、美团如今所面临的问题

1、用户购买与消费的空间距离很小

 


图4.分品类持券80%距离

 

2、用户购买与消费的时间差很短


图5.分品类持券时长

3、用户场景时刻在变化

如:地理位置不断变化,用户需求随位置而变,推荐的内容要适配这种变化等

4、用户行为稀疏,粘性不够强

相邻两次访问的时间间隔长,新用户流失比例高,生命周期偏短

5、数据多,用户请求量大

每天要处理的数据达到T级别,每天千万级的用户,上亿次请求

 

三、应对方案

针对上述诸多面临的问题,可采取如下等方案进行应对,如:强化地理位置特征;提高算法实时性;算法融合,个性化push;框架优化等。

1、地理位置

(1)对于地理位置的维度,可以通过实时地理位置、常去地理位置、工作地、居住地、消费地等位置信息进行确认。

(2)地理位置直接触发

     离线:挖掘区域消费优质deal和区域购买优质deal

 

图6.地理位置触发示意

在线:获取用户的地理位置信息,对区域deal列表进行加

(3)根据用户的地理位置轨迹计算用户相似度,与协同的用户相似度叠加权

   算法示意:

User1:geo1:count1; geo2:count2; geo3:count3 …

 

User2:geo1’:count1’; geo2’:count2’; geo3’:count3’ …

图7.算法示意地理位置信息

 

(4)基于消费poi的相似度计算

      Deal中包含的地理位置信息较弱

      Poi同时包含了用户的偏好与商圈倾向

 

图8.poi的相似度计算图示

(5)作为重排序模型的特征

     用户实时地理位置与deal所在poi的最近距离

     用户常去地理位置与deal所在poi的最近距离

     用户消费地理位置与deal所在poi的最近距离

2、实时推荐

对于实时推荐由于用户场景经常变化,需求随之而变;离线计算好结果的推荐方式适应性差;每次请求都要实时计算。

(1)实时数据流



图9.实时行为:搜索、筛选、收藏、浏览、下单

①算法使用新的用户行为数据进行推荐

未转化行为实时反馈至推荐结果


图10.实时数据流程图

②算法准实时更新

    Itembased cf 小时级更新

    看了又看:6%+ 提升

Userbased cf 准实时更新

增量计算

    4小时更新一次

(2)实时rerank

  子算法计算出来的权重考虑的因素太少

  不同子算法的权重不具有可比性

  模型选择

    线性、非线性结合

  特征

    deal维度的特征

    user维度的特征

    userdeal的交叉特征

    距离特征

  ◎在线特征抽取,模型实时计算

在线学习算法FTRL

 

(3)算法融合&push

①算法融合包括:

  加权型:对各个算法产生的候选集按照权重进行加权

  分级型:优先采用效果好的算法,再使用效果次好的算法,依此类推

  调制型:不同的算法按照不同的比例产生一定量的候选集组成总的候选集

  过滤型:当前的算法对前一级算法产生的候选集进行过滤,依此类推,候选集被逐级过滤,   

         最终产生一个小而精的候选集合

②个性化push

  用户相邻两次访问间隔长

  触及更多的用户,提升日活用户数

  不能过度打扰用户

最初的做法:用户拉取;Push时机不可调;系统压力大;不能实时推荐

改为push以后:根据用户的历史联网时间确定push发送时机,根据用户的实时定位发送,

发出率提高24%,打开率提高21%,综合转化率提高94%

(4)框架优化


图11.框架优化示意图

 

图12.海量数据处理示意图

 

随着日益增长的用户请求,将业务进行拆分,较重的业务独立出来;采用多算法并行;建立统一数据模型,减少冗余请求。

运用触发层与排序层分离;模型训练并行化;参数实时加载,支持快速调参达到快速的效果迭代。

 

 

整个优化方案将地理位置因素的引入:解决用户冷启动和稀疏性,提高推荐精度;

将候选集进行融合:提高了推荐的覆盖度、多样性;引入重排序模型:解决了候选集增加以后deal之间排列顺序的问题。我们争取以数据为基础,用算法去雕琢,发现问题并进行修正,运用良好的基础架构,高效的算法迭代,发挥团队的力量。


PPT http://club.alibabatech.org/resource_detail.htm?topicId=186

 

相关文章
|
9月前
|
Prometheus 运维 监控
监控没做好,DevOps等于裸奔:Prometheus + ELK 的“稳态运营秘籍”
监控没做好,DevOps等于裸奔:Prometheus + ELK 的“稳态运营秘籍”
442 26
|
新能源 芯片
半导体技术的发展与应用
一、半导体的定义与特性 1.1 什么是半导体 半导体是一种介于导体和绝缘体之间的材料,其导电性介于金属和非金属之间。半导体的电阻率介于导体和绝缘体之间,具有导电能力,但不像金属那样导电能力强。 1.2 半导体的特性 半导体的最重要特性之一是其导电性能的可控性。通过控制半导体材料的杂质掺入和电场作用,可以改变其导电性能,从而实现各种电子器件的设计与制造。 二、半导体技术的发展历程 2.1 半导体的早期发展 20世纪初,人们开始研究半导体材料,但当时对半导体的认识非常有限,无法实现对其导电性能的控制。直到20世纪40年代末,人们才开始逐渐认识到半导体材料的重要性。 2.2 半导体技术的突破 在20
506 0
|
7月前
|
监控 安全 数据建模
阿里云SSL证书活动参考,付费证书248元起,免费证书每用户每年可申请20张
2026年阿里云SSL证书活动推出付费证书248元起、新老用户同享8折优惠,覆盖DV到EV全类型,满足个人网站至金融机构多样化需求。活动包括新用户专区优惠、证书加急部署服务、HTTPS加速网关及域名监控等增值服务。此外,阿里云还为用户提供免费版SSL证书,每个自然年可领20张。
998 4
阿里云SSL证书活动参考,付费证书248元起,免费证书每用户每年可申请20张
|
11月前
|
机器学习/深度学习 算法
Proximal SFT:用PPO强化学习机制优化SFT,让大模型训练更稳定
本文介绍了一种改进的监督微调方法——Proximal Supervised Fine-Tuning (PSFT),旨在解决传统SFT易过拟合、泛化能力差及导致“熵坍塌”的问题。受PPO强化学习算法启发,PSFT通过引入参数更新的稳定性机制,防止模型在训练中变得过于确定,从而提升探索能力与后续强化学习阶段的表现。实验表明,PSFT在数学推理、模型对齐及泛化能力方面均优于传统SFT。
1003 3
Proximal SFT:用PPO强化学习机制优化SFT,让大模型训练更稳定
|
人工智能 前端开发 数据可视化
2024年低代码趋势洞察——企业最看重的功能有哪些
低代码平台正从“可选”工具转变为数字化转型的“必需品”。预计到2024年,全球超70%企业将引入低代码开发工具。其优势包括简化开发流程、提高效率、降低成本,支持可视化开发、多人协作、快速部署等。平台通过五大核心引擎(SQL、功能、模板、图表、切面)驱动高效开发,并结合AI技术提升智能化水平。此外,丰富的插件生态和开源支持保障了灵活性与扩展性,助力企业在复杂业务场景中实现高效运营与决策。
539 14
|
机器学习/深度学习 算法 量子技术
《深度揭秘:拉普拉斯平滑在朴素贝叶斯算法中的关键作用与参数选择之道》
朴素贝叶斯算法在文本分类、情感分析等领域广泛应用,但常遇零概率问题,即某些特征从未与特定类别同时出现,导致条件概率为零,影响模型准确性。拉普拉斯平滑通过在计数上加一小正数(如α=1),避免了零概率问题,提升了模型的稳定性和泛化能力。选择合适的平滑参数α至关重要:经验法则通常设α=1;交叉验证可找到最优α值;根据数据规模和特征分布调整α也能有效提升模型性能。
879 19
centos8 Failed to download metadata for repo ‘base‘: Cannot download repomd.xml
centos8 Failed to download metadata for repo ‘base‘: Cannot download repomd.xml
1754 1
|
机器学习/深度学习 自然语言处理 数据安全/隐私保护
探索Qwen2.5大模型在车险理赔领域的应用
本文探讨了Qwen2.5大模型在车险理赔领域的应用,特别是通过微调模型来优化理赔流程、提高反欺诈能力。文章介绍了车险理赔的数据特点和业务流程,展示了如何准备数据、微调模型,并进行了模型评估和部署的示例。通过这些方法,Qwen2.5能够显著提升理赔效率和准确性,减少人工干预。
1556 1
|
Web App开发 测试技术 API
使用Ollama和Botnow本地部署DeepSeek R1模型的对比分析
本文详细对比了使用Ollama和Botnow两种方式在本地运行DeepSeek R1等开源大模型的不同。通过Ollama,用户可以在个人电脑(如MacBook Pro)上快速部署和测试模型;而Botnow则提供了企业级的API接入和本地部署方案,支持更复杂的应用场景。具体步骤包括环境准备、模型下载与运行、图形化界面操作等,帮助用户选择最适合自己的方式体验大模型的强大功能。
1106 0
|
安全 Ubuntu Linux
在Linux中,如何进行FTP服务器配置?
在Linux中,如何进行FTP服务器配置?