淘宝粗排问题之引入未曝光样本和随机负样本对粗排模型有何影响,如何解决

简介: 淘宝粗排问题之引入未曝光样本和随机负样本对粗排模型有何影响,如何解决

问题一:淘宝主搜索的多阶段检索系统主要包括哪些阶段?粗排阶段与精排阶段的主要差异是什么?


淘宝主搜索的多阶段检索系统主要包括哪些阶段?粗排阶段与精排阶段的主要差异是什么?


参考回答:

淘宝主搜索的多阶段检索系统主要包括召回、粗排、精排等阶段。召回阶段由文本召回、个性化等多路召回构成,粗排阶段从多路召回集合中筛选,精排阶段再进行筛选输出最终给用户的曝光商品。

粗排阶段与精排阶段的主要差异在于目标不同。粗排注重从海量候选集中选出优质的子集,而精排则更注重头部商品的排序。因此,尽管两者都是排序,但优化的方向和目标存在显著差异。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/654784



问题二:为什么只提高NDCG而不增加负采样会让粗排效果更差?


为什么只提高NDCG而不增加负采样会让粗排效果更差?


参考回答:

只提高NDCG而不增加负采样会让粗排效果更差,是因为NDCG这个指标本身与粗排实际的优化方向存在很大偏差。粗排最要解决的是如何从召回集合中选出优质的子集,而NDCG无法衡量召回-粗排的损失,也无法衡量粗排负采样的好坏。因此,盲目提高NDCG并不一定能提升粗排的实际效果。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/654785



问题三:今年引入的“全域成交hitrate”作为粗排评价标准有什么作用?


今年引入的“全域成交hitrate”作为粗排评价标准有什么作用?


参考回答:

今年引入的“全域成交hitrate”作为粗排评价标准,可以帮助我们更准确地衡量召回-粗排的损失,从而更有效地评估粗排负采样的好坏。通过这一指标,我们可以对从召回->粗排->精排的全域成交漏斗损失进行系统的分析,进而规范与统一各个阶段的优化空间和优化目标。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/654786



问题四:引入未曝光样本和随机负样本对粗排模型有何影响?


引入未曝光样本和随机负样本对粗排模型有何影响?


参考回答:

引入未曝光样本和随机负样本这两部分负样本的扩充共带来约5.5 pt的场景外的hitrate的提升,这有助于模型更好地拟合粗排阶段的打分空间。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/654787



问题五:在粗排模型中,蒸馏任务的作用是什么?


在粗排模型中,蒸馏任务的作用是什么?


参考回答:

在粗排模型中,蒸馏任务的作用是进一步提高模型与精排模型的一致性。具体做法是在曝光样本上让粗排模型学习精排模型的打分分数,从而使粗排模型能够学习到精排模型的排序逻辑。


关于本问题的更多回答可点击原文查看:

https://developer.aliyun.com/ask/654788

相关文章
|
PyTorch 算法框架/工具
【IOU实验】即插即用!对bubbliiiing的yolo系列代码替换iou计算函数做比对实验(G_C_D_S-IOU)
【IOU实验】即插即用!对bubbliiiing的yolo系列代码替换iou计算函数做比对实验(G_C_D_S-IOU)
324 0
【IOU实验】即插即用!对bubbliiiing的yolo系列代码替换iou计算函数做比对实验(G_C_D_S-IOU)
|
人工智能 数据挖掘 CDN
魔哈镜像迄今最大合成数据集 Cosmopedia
Cosmopedia 是一个由Mixtral-8x7B-Instruct-v0.1生成的合成教科书、博文、故事、帖子和WikiHow文章的数据集。该数据集包含超过3000万个文件和250亿个tokens,是HuggingFace用了10k张H100生成的迄今为止最大的开放合成数据集。
697 0
|
7月前
|
人工智能 运维 数据可视化
OpenClaw是什么?OpenClaw能做什么?2026年阿里云OpenClaw(原Clawdbot/Moltbot)部署官方教程
在2026年AI Agent全面爆发的浪潮中,OpenClaw凭借“开源可控、本地优先、全场景适配”的核心优势,成为个人、新手开发者及轻量团队搭建专属AI助手的首选工具,其前身为备受关注的Clawdbot与Moltbot,历经品牌迭代后,于2026年正式统一命名为OpenClaw,核心功能一脉相承且全面升级,彻底打破了传统AI工具“只会说不会做”的局限,成为真正能替人干活的“数字员工”。
4485 6
|
12月前
|
机器学习/深度学习 文字识别 算法
面向古籍版面数字化识别应用研究—基于HisDoc-DETR模型深入剖析
针对古籍版面复杂、文字稀疏、数据稀缺等难题,合合信息与华南理工大学联合提出HisDoc-DETR模型。该框架融合Transformer全局建模与CNN局部特征提取优势,创新引入语义关系学习、双流特征融合及GIoU感知预测头三大模块,显著提升古籍逻辑与物理结构的识别精度,在SCUT-CAB数据集上性能超越主流方法,为古籍数字化、知识库构建与文化遗产传播提供强有力的技术支撑。
面向古籍版面数字化识别应用研究—基于HisDoc-DETR模型深入剖析
|
搜索推荐
召回和粗排负样本构造问题
召回和粗排负样本构造问题
658 0
|
机器学习/深度学习 自然语言处理 搜索推荐
承上启下:基于全域漏斗分析的主搜深度统一粗排
两阶段排序(粗排-精排)一开始是因系统性能问题提出的排序框架,因此长期以来粗排的定位一直是精排的退化版本,业内的粗排的优化方向也是持续逼近精排。我们提出以全域成交的hitrate为目标的全新指标,重新审视了召回、粗排和精排的关系,指出了全新的优化方向
94809 3
|
机器学习/深度学习
阿里妈妈首提AIGB并实现大规模商业化落地,将在NeurIPS 2024正式开源Benchmark
阿里妈妈提出AI-Generated Bidding(AIGB)新范式及DiffBid生成式竞价模型,突破传统基于强化学习的自动竞价方法局限。AIGB将自动竞价视为生成问题,通过捕捉复杂依赖关系,提升长期规划和随机环境中的稳定性和效果。DiffBid基于条件扩散建模,灵活生成满足特定目标的竞价轨迹,显著提升GMV和ROI。实验结果表明,DiffBid实现了2.81%的GMV增长和3.36%的ROI增长。然而,生成式建模的复杂性也带来了训练和调优的挑战。 论文链接:https://arxiv.org/abs/2405.16141
974 9
|
机器学习/深度学习 监控 搜索推荐
深度粗排模型的GMV优化实践:基于全空间-子空间联合建模的蒸馏校准模型
随着业务的不断发展,粗排模型在整个系统链路中变得越来越重要,能够显著提升线上效果。本文是对粗排模型优化的阶段性总结。
2561 0
深度粗排模型的GMV优化实践:基于全空间-子空间联合建模的蒸馏校准模型
|
人工智能 JSON Java
列表结构与树结构转换分析与工具类封装(java版)
本文介绍了将线性列表转换为树形结构的实现方法及工具类封装。核心思路是先获取所有根节点,将其余节点作为子节点,通过递归构建每个根节点的子节点。关键在于节点需包含 `id`、`parentId` 和 `children` 三个属性。文中提供了两种封装方式:一是基于基类 `BaseTree` 的通用工具类,二是使用函数式接口实现更灵活的方式。推荐使用后者,因其避免了继承限制,更具扩展性。代码示例中使用了 Jackson 库进行 JSON 格式化输出,便于结果展示。最后总结指出,理解原理是进一步优化和封装的基础。
548 0
淘宝粗排问题之对粗排阶段打分集合归因到对应的场景内和场景外成交如何解决
淘宝粗排问题之对粗排阶段打分集合归因到对应的场景内和场景外成交如何解决

热门文章

最新文章