【科研数据分享】CTR预估数据集汇总

简介: 【科研数据分享】CTR预估数据集汇总

数据作为支撑AI技术发展的基础要素,其重要性不言而喻,高质量的科研数据集对领域技术的发展起着重要的推动作用。天池数据集致力于提供优质的科研数据,以帮助算法从业人员更好地开展模型研究。

本期天池君为大家推荐了5个常用的点击率预估 (CTR estimation) 数据集,点击率预估 (CTR estimation) 是在线信息系统的核心模块之一,是推荐系统、付费广告、搜索引擎重要的组成部分,广泛的应用于商品购物、短视频、本地生活等领域中,与人们的生活息息相关,具有重要的业务价值。随着深度学习的广泛应用,深度点击率预估模型被广泛用于工业界的线上系统中。


本文整理了学术界/业界公用的CTR预估数据集,方便算法研发人员学习。

1

Kaggle Display Advertising Challenge Dataset by Criteo

简介:This dataset is provided by Criteo, and it contains feature values and click feedback for millions of display ads. Its purpose is to benchmark algorithms for clickthrough rate (CTR) prediction.

官网下载地址:

https://ailab.criteo.com/ressources/

天池下载地址:

https://tianchi.aliyun.com/dataset/144733

2

Criteo 1TB Click Logs Dataset

简介:This dataset contains feature values and click feedback for millions of display ads. Its purpose is to benchmark algorithms for clickthrough rate (CTR) prediction. It is similar, but larger, to the dataset released for the Display Advertising Challenge hosted by Kaggle.

官网下载地址:

https://ailab.criteo.com/download-criteo-1tb-click-logs-dataset/

天池下载地址:

https://tianchi.aliyun.com/dataset/144736

3

Amazon Product Data

简介:This dataset contains product reviews and metadata from Amazon, including 233.1 million reviews spanning May 1996 - Oct 2018. This dataset includes reviews (ratings, text, helpfulness votes), product metadata (descriptions, category information, price, brand, and image features), and links (also viewed/also bought graphs).

参考论文:

Justifying recommendations using distantly-labeled reviews and fined-grained aspects.

Jianmo Ni, Jiacheng Li, Julian McAuley. Empirical Methods in Natural Language Processing (EMNLP), 2019

官方下载地址:

https://nijianmo.github.io/amazon/index.html

天池下载地址(图书类目):

https://tianchi.aliyun.com/dataset/145340

4

淘宝展示广告点击率预估数据集

简介:Ali_Display_Ad_Click是阿里巴巴提供的一个淘宝展示广告点击率预估数据集。

参考论文:

1. Gai K, Zhu X, Li H, et al. Learning Piece-wise Linear Models from Large Scale Data for Ad Click Prediction[J]. arXiv preprint arXiv:1704.05194, 2017. 2. Guorui Zhou, Chengru Song, Xiaoqiang Zhu, et al. Deep Interest Network for Click-Through Rate Prediction. arXiv preprint arXiv:1706.06978, 2017.

下载地址:

https://tianchi.aliyun.com/dataset/56

5

饿了么推荐数据集

简介:The dataset is constructed by click logs from ele.me online recommendation system, including 8 days' data with 146 million sample records.

下载地址:

https://tianchi.aliyun.com/dataset/131047


相关文章
|
Python
数学建模——统计回归模型
数学建模——统计回归模型
183 0
|
机器学习/深度学习 自然语言处理 搜索推荐
文本点击率预估挑战赛-冠亚季军方案总结(上)
文本点击率预估挑战赛-冠亚季军方案总结(上)
437 0
文本点击率预估挑战赛-冠亚季军方案总结(上)
|
9天前
|
数据采集 数据可视化 数据挖掘
金融波动率的多模型建模研究:GARCH族与HAR模型的Python实现与对比分析
本文探讨了金融资产波动率建模中的三种主流方法:GARCH、GJR-GARCH和HAR模型,基于SPY的实际交易数据进行实证分析。GARCH模型捕捉波动率聚类特征,GJR-GARCH引入杠杆效应,HAR整合多时间尺度波动率信息。通过Python实现模型估计与性能比较,展示了各模型在风险管理、衍生品定价等领域的应用优势。
127 65
金融波动率的多模型建模研究:GARCH族与HAR模型的Python实现与对比分析
|
7月前
|
机器学习/深度学习 算法
【阿旭机器学习实战】【30】二手车价格预估--KNN回归案例
【阿旭机器学习实战】【30】二手车价格预估--KNN回归案例
|
8月前
R语言用回归构建配对交易(Pairs Trading)策略量化模型分析股票收益和价格
R语言用回归构建配对交易(Pairs Trading)策略量化模型分析股票收益和价格
|
机器学习/深度学习 搜索推荐 算法
课时2:基于GBDT算法的CTR预估
课时2:基于GBDT算法的CTR预估
|
机器学习/深度学习 搜索推荐 算法
《基于深度学习的广告CTR预估算法》电子版地址
基于深度学习的广告CTR预估算法
86 0
《基于深度学习的广告CTR预估算法》电子版地址
|
机器学习/深度学习 资源调度 算法
推荐系统[三]:粗排算法常用模型汇总(集合选择和精准预估),技术发展历史(向量內积,Wide&Deep等模型)以及前沿技术
推荐可分为以下四个流程,分别是召回、粗排、精排以及重排: 1. 召回是源头,在某种意义上决定着整个推荐的天花板; 2. 粗排是初筛,一般不会上复杂模型; 3. 精排是整个推荐环节的重中之重,在特征和模型上都会做的比较复杂; 4. 重排,一般是做打散或满足业务运营的特定强插需求,同样不会使用复杂模型;
推荐系统[三]:粗排算法常用模型汇总(集合选择和精准预估),技术发展历史(向量內积,Wide&Deep等模型)以及前沿技术
|
机器学习/深度学习 搜索推荐 算法
推荐系统专题 | CTR预测跨域处理的解决方案
推荐系统专题 | CTR预测跨域处理的解决方案
281 0
推荐系统专题 | CTR预测跨域处理的解决方案
|
机器学习/深度学习 算法 Python
数学建模国赛:python机器学习基础之训练集和测试集拆分、算法精确率评估
数学建模国赛:python机器学习基础之训练集和测试集拆分、算法精确率评估
224 0
数学建模国赛:python机器学习基础之训练集和测试集拆分、算法精确率评估