开发者社区> 大数据与机器学习> 智能搜索推荐

智能搜索推荐

关注

智能推荐(Artificial Intelligence Recommendation,简称AIRec)基于阿里巴巴大数据和人工智能技术,以及在电商、内容、直播、社交等领域的业务沉淀,为企业开发者提供场景化推荐服务、全链路推荐系统开发平台、工程引擎组件库等多种形式服务,助力在线业务增长。

2
今日
640
内容
1
活动
4256
关注
|
负载均衡 异构计算
|

gig:自带负载均衡和降级功能的高可用RPC解决方案

gig基于对latency的负反馈控制,实现了坏节点屏蔽、服务预热、异构集群负载均衡、自动降级等功能,大大提高了阿里搜索线上服务的稳定性。

8444 0
|
存储 消息中间件 安全
|

计算与存储分离实践—swift消息系统

swift是搜索事业部自主研发分布式消息系统,它的主要存储基于分布式文件系统,资源需求基于分布式调度系统。swift能支持每秒数亿的消息传递,支持PB级消息的存储。

7484 0
|
资源调度 调度 混合部署
|

阿里巴巴搜索混部解密

Hippo是搜索调度团队根据搜索、推荐、广告等业务特点从2013年开始打造并逐步完善的一套分布式调度系统,支持了集团内外多个事业部的搜索、推荐、广告等相关业务。2017双11期间,搜索在离线混部实现了全时段无干预无降级稳定运行,提供了搜索双11所有TF模型离线批次训练所需资源,并在2017/11/10晚上23点因为离线训练集群负载过高首次在混部上不间断运行了超过2万core的双11实时训练流程并一直在稳定运行。

8498 0
|
运维 数据可视化 算法
|

阿里集团搜索中台TisPlus

                        阿里集团搜索中台TisPlus 搜索中台的发展     从阿里很多技术产品的发展路径来看都遵循着技术驱动、产品驱动、数据驱动三个阶段,那阿里巴巴的搜索技术的发展也基本基于上述的发展路径。

11371 2
|
缓存 监控 搜索推荐
|

一种基于Lucene的实时搜索服务

因为本文篇幅有限,在这里我只会着重介绍:实时性、高可用性在我们产品中的一些技术实践。 实时解决方案 在介绍我们产品方案之前,首先介绍下业内常见的实时解决方案,见图1-1实时架构图: ![P1](http://img3.

6379 0
|
机器学习/深度学习 新零售 开发工具
|

拍立淘Open SDK-在你的App里用相机连接淘宝和世界

使用拍立淘OpenSDK,可以在你的App里用相机连接淘宝和世界。。。

8438 0
|
机器学习/深度学习 算法 openCL
|

Jarvis-拍立淘里面的深度学习引擎

深度学习的原理?局部响应归一化的作用?兄弟今天不是来讨论这个的,那都是科学家和算法同学的事儿。作为一个深度学习引擎,使命只有一个——就是快速和准确的计算。那怎么才能快呢?。。。借助于GPU(OpenCL),可以让运算飞起。。。

5411 0
|
搜索推荐 API 开发者
|

OpenSearch:轻松构建大数据搜索服务

随着互联网数据规模的爆炸式增长,如何从海量的历史、实时 数据中快速获取有用信息,变得越来越具有挑战性。搜索是获取信息最高效的途径之一,因此也是各类网站、应用的基础标配功能。开发者想在自己的产品中实现搜索功能一般都是基于某个开源搜索系统(如ElasticSearch、Solr、Sphinx

17977 3
|
存储 SQL 分布式数据库
|

Drill官网文档翻译六:存储插件的注册

我们可以通过存储插件连接到本地文件系统,Hive,HBase,或是其他的数据源。在Drill的web界面的存储插件配置tab,你可以查看修改这些插件的配置。如果不支持HTTPS(默认就没有),你可以访问HTTP://{IP}:8047/storage 来查看和配置存储插件。可以用IP,也可以用ho.

3633 0
|
存储
|

Drill官网文档翻译五:连接到数据源

存储插件是Drill中,连接到数据源的模块。一个存储插件通常会优化Drill查询的执行,提供数据的定位,命名空间下的配置和读数据要用到的格式。Drill已经内置了一些存储插件,你只需要根据你的环境配置一下就可以使用了。借助存储插件,你可以连接到各种数据源,像数据库,本地或是分布式的文件,或是Hiv.

3862 0
|
存储
|

Drill官网文档翻译四 Drill的性能

(翻译自apache drill 官网。) Drill是从地基开始就奔向高性能和大数据集去设计的,下面列出来的是Drill能够做到高性能的核心要点。 分布式的引擎 Drill提供了一个强大的分布式引擎来处理查询。用户可以从集群的任何一个节点是提交查询。你可以添加新的节点到集群中,以为了支持更多

4888 0
|
SQL 存储 HIVE
|

Drill官网文档翻译三:Drill的核心模块

(翻译自Drill官网) 核心模块 下图描述了一个drillbit里的各个组件 下面列出drillbit里的关键组件: RPC endpoint Drill开发了一种基于Probobuf的损耗非常低的RPC通信协议来跟客户端打交道。另外,客户端程序也可以使用C++或是JAVA api层来跟

3762 0

Drill官网文档翻译二:Drill查询的执行

(翻译自Drill官网) 当您提交Drill查询的时候,客户端或应用程序会把查询以SQL语句的形式发送到Drill集群的一个Drillbit。Drillbit是在每个在线的Drill节点上运行的进程,它负责协调,规划和执行查询,并按照最大限度地实现数据本地化的原则在集群中分发查询。 下图描述了客

5202 0
|
SQL 存储 Apache
|

Drill官网文档翻译一 基本架构

(翻译自apache drill 官网) 架构总览 Apache drill是在大规模数据集场景下,可以低延迟地进行结构和半结构化/嵌套数据结构查询的一个分布式查询引擎。受到谷歌公司的Dremel的启发,Drill被设计出来以支持几千个节点和PB级别的数据规模下,支持交互响应级别的商务智

9774 0
|
算法 数据挖掘 搜索推荐
|

技术论文:电子商务中基于生命阶段的推荐(发表于 ACM KDD2015 )

ACM SIGKDD 国际会议(简称 KDD)是数据挖掘研究领域的顶级盛会,它每年能收到上千篇来自国际知名大学和研究机构的学术论文投稿,这其中仅有一小部分优秀论文可以被接收。2015年5月18日,KDD组委会发布工业和政府相关方向论文的录用消息,阿里巴巴集团搜索事业部推荐团队投稿的论文被录用,表

7326 0
|
算法
|

基于动态混合高斯模型的商品价格模型算法

1. 背景     作为电子商务网站,淘宝网上的每个商品都有一个价格,该价格从一个很重要的维度上反应出一个商品的品质。但是由于该价格是由第三方卖家自己确定的,因此存在一定的随机性。一个价格过低的商品,其假货的可能性往往较大,比如500元的劳力士手表,或者商品的质量存在问题;同时一个价格过高的商品,

6496 0
|
缓存 算法 异构计算
|

拍立淘---试妆魔镜 OpenGL ES 2.0 框架及性能优化

手机淘宝(搜索框->摄像头->试妆魔镜): 最初的设计原型及性能问题: 单线程模型,优先级过低:从Camera获取到CMSampleBufferRef YUV图像帧,拷贝像素数据到内存(多了一次拷贝内存的开销)进行美妆渲染以及一些其他的检测计算,导致的render线程性能消耗过多,CPU负

10280 0
|
存储 Java 分布式数据库
|

海量数据实时计算利器Tec

引子 在刚刚过去的2015年双11大促中,搜索事业部的实时计算和在线学习系统Pora经受住了前所未有的双11巨量用户行为消息的冲击,在流入实时消息量持续超过300w/s,甚至峰值飙升至501w/s的压力下始终保持了端到端秒级实时效果,助力相关的搜索和推荐实时业务取得了很好的效果。 Pora如何能

12678 1
|
分布式计算 Hadoop 流计算
|

Hadoop summit 2015 实时计算

有幸参加了6月9号到6月11号在圣何塞举办Hadoop summit 2015,主要关注了实时计算相关的topic。 本次参会的主要感受是:实时处理成为各个公司的标配,OLAP是基本需求。 下面我主要分享如下三个议题: 实时计算框架(主要是storm,spark主题太少,涉及实时计算的基本没有

4426 0
|
分布式计算 运维 算法
|

DII—算法服务利器

随着集团内各种离线处理、实时反馈、在线学习和分析系统的发展壮大,为算法同学使用数据提供了更多的手段和玩法,能够从数据中挖掘出更多的宝藏。但是仅仅产出数据是不够的,他们需要将数据结合算法在线服务的方式应用到业务中去,才能真正产生价值。从搜索事业部的现状来看,算法的作用方式主要有两种,一种是嵌入引擎内.

12317 2
|
算法 搜索推荐 双11
|

实时离线平台Pora介绍@2015

12535 2
|
搜索推荐 固态存储 双11
|

iGraph 2015双促复盘总结

10175 1
|
算法 搜索推荐 前端开发
|

搜索双链路实时计算体系@双11实战

该文章来自阿里巴巴技术协会(ATA)精选集  0. 前言 何为双链路实时计算体系?微观实时计算链路 a) 最细粒度商品/店铺/用户数据的实时 b) 底层模型的实时宏观实时计算链路 相比微观实时,宏观实时的对象粒度更粗,更上层 a) 以实时效果为目标,基于bandit learning的实

16664 2
|
11天前
|
数据采集 人工智能 算法
|

38条引用源实测:AI引擎内容分发机制与信任预埋路径解析

本文基于38条真实引用数据,揭示AI引擎(豆包/DeepSeek/秘塔)不直接抓取全网,而是依赖平台推荐算法间接发现内容;关键词堆砌无效,语义匹配与可验证细节(如具体参数、客户数据)才是关键;垂直小站亦有机会被引。提出可复现的“平台地图测绘法”,并对比AI优化与传统投放的边际成本差异。

83 0
|
11天前
|
数据采集 人工智能 自然语言处理
|

AI搜索引用机制解析:从用户提问到答案合成的完整链路

截至2025年6月,国内生成式AI用户达5.15亿。本文实测豆包、秘塔等AI引擎引用源,揭示“语义匹配”替代关键词搜索的底层逻辑,拆解从提问到答案合成的完整链路,并提供可复现的平台选择(CSDN/头条/搜狐号)与结构化信息块构建方法。

89 0
|
11天前
|
人工智能 运维 搜索推荐
|

技术社区GEO监测体系建设的探索与实践 ——基于GEO双五模型差异化信任机制的量化运营路径

本文提出技术社区GEO(生成式引擎优化)监测体系,基于通义千问、豆包、DeepSeek等大模型差异化信任机制,构建“先治理、后建设、再验证、长迭代”的五层架构与五级成熟度量化框架,助力社区提升AI引用率与首选率。(239字)

58 1
|
12天前
|
数据采集 人工智能 算法
|

3类信息块结构:用户评价被AI引擎引用的机制解析

本文解析AI引擎引用用户评价的底层机制,指出动态加载与语义密度不足是两大根因;提出“场景-数据-时间线”三维信息块结构,详解从评论区到静态HTML的改造三步法,并强调平台适配与真实信任资产建设,助力企业提升AI搜索可见度。

54 0
|
12天前
|
数据采集 人工智能 算法
|

31亿AI用户迁移:家政服务决策链路与AI引用机制拆解

本文基于CNNIC及《生成式AI应用发展报告(2025)》,解析家政行业用户决策从分类平台转向AI搜索的底层逻辑,揭示AI引擎引用机制、家政类问题源分布特征及内容结构化方法,提供可复现的AI搜索可见性提升路径。

50 0
|
12天前
|
人工智能 小程序 算法
|

4个核心指标拆解:酒店客源结构分析与AI搜索渠道监测机制

本文提出酒店客源分析的四维评估框架(间夜量、ADR、获客成本、复购率),揭示OTA与直销渠道在数据归属、成本结构及复购潜力上的本质差异,并首创AI搜索引用监测机制,指导酒店通过内容沉淀抢占新兴流量入口。全文基于真实月度数据,方法可复现、操作可落地。

76 0
|
13天前
|
人工智能 搜索推荐 定位技术
|

3.53亿新增用户流向:豆包、Kimi、ChatGPT引用源生态实测对比

CNNIC第57次报告指出:搜索用户年减9600万,AI用户增3.53亿。用户正从搜索框迁入AI对话框。本文实测豆包、Kimi、ChatGPT对中文企业内容的引用差异——豆包偏爱CSDN/头条/知乎等开放平台,Kimi倾向深度媒体,ChatGPT则几乎不引中文内容。企业应依客户所在引擎布局内容,而非追逐技术榜单。

72 0
|
13天前
|
人工智能 算法 测试技术
|

45条引用源实测:AI引擎内容分发机制解析

2026年5月实测豆包AI引用源:45条数据揭示真相——CSDN(34%)、头条(16%)成主力,企业官网引用率为0!本文拆解AI内容选择机制,解析四大平台“被引用公式”,并提供可复现的5步平台地图法,助企业从“不可见”走向AI答案首选。

72 0
|
13天前
|
人工智能 测试技术 数据处理
|

Apache Doris 在内容 AI 生产链路中的实践:从内容打标到可追溯数据链路

本文结合内容电商 AI 打标真实痛点,深度拆解如何解耦特征(Feature)、决策(Decision)与结果(Result),并基于 Apache Doris 4.x(VARIANT 半结构化 + 混合检索 + 增量物化视图)搭建统一的内容事实库,实现从模型推理到全链路可追溯的数据治理,为上层 AI Agent 打造坚实的数据底座。

51 0
|
14天前
|
人工智能 Cloud Native 关系型数据库
|

数字化转型赋能GEO优化:基于阿里云原生的企业AI信源建设实践

本文揭示AI大模型(如通义千问)RAG检索中企业内容“语义不可达”的痛点,提出基于阿里云原生服务的GEO内容引擎实践方案:通过结构化拆解、语义向量化、知识图谱补全、多渠道智能分发与效果监控四层架构,提升品牌在AI回答中的提及率与信源引用率。

77 1
|
14天前
|
数据采集 人工智能 搜索推荐
|

两组引擎的差异:AI搜索排名与百度排名的机制对比

本文基于普林斯顿大学论文与CNNIC《2025生成式AI应用报告》,从检索单位(页面vs信息块)、信任机制(权重积累vs交叉印证)、资产性质(租用流量vs累积引用)三维度,揭示AI搜索与百度排名的本质差异,指出AI优化重在信息块质量与平台推荐链路。

85 0
|
14天前
|
人工智能 开发框架 自然语言处理
|

什么是AI品牌营销?定义、技术架构与企业Agent落地方式

AI品牌营销是将AI深度融入品牌全链路的能力系统:从数据诊断、身份结构化、知识治理,到内容生成、AI认知监测、Agent执行与销售转化,实现品牌营销的数据化、自动化与持续反馈,超越单纯AI内容生产。

56 0
|
14天前
|
数据采集 人工智能 监控
|

34%引用率提升机制解析:婚庆内容如何被AI引擎主动抓取

2026年实测显示,婚庆内容在豆包、DeepSeek等AI引擎中引用缺口高达87%。本文基于Princeton研究,揭示提升引用率的三大关键因子(引用来源+34.4%、统计数据+32.1%、直接引语+29.7%),对比知乎、小红书等四类平台权重,并给出可复现的内容结构改造路径。

62 0
|
14天前
|
数据采集 人工智能 自然语言处理
|

4个提问词实测:AI答案引用占比如何量化内容价值

本文提出以“AI答案引用占比”为核心指标,量化内容资产增长。通过实测豆包、DeepSeek、Kimi三大引擎对4个行业提问词的引用来源分布,提供从数据采集、跨平台内容适配到效果报告的完整方法论,助力团队向决策层清晰呈现内容投入价值。

62 3
|
15天前
|
数据采集 人工智能 监控
|

4个提问词摸清AI引用偏好:B2B物流内容建设路径拆解

B2B物流企业进军AI搜索,关键不在优化官网,而在搞清客户如何向AI提问。本文基于豆包引擎45条实测引用源,拆解平台地图绘制、多平台公式化改写、官网信息块重构及词库监控四步法,提供可复现的操作路径与量化指标。

67 0
|
15天前
|
人工智能 开发框架 机器人
|

MIND模型和普通品牌咨询方法有什么区别?从业务方法论到企业Agent能力结构化

MIND模型区别于传统品牌咨询,不止于“定位”,而是构建Map(看清楚)、Identity(想清楚)、Network(传出去)、Deal(卖出去)的闭环增长链路,并结构化支撑AI时代企业Agent所需的数据、身份、内容与成交能力。(239字)

60 0
|
15天前
|
数据采集 人工智能 算法
|

45条引用源平台分布实测:AI引擎内容引用的三大筛选机制解析

本文基于豆包引擎实测数据(45条引用源,中文平台占比71%),揭示AI引用内容的底层逻辑:非随机抓取,而是依赖平台推荐算法筛选后的“二次筛选”。提出被AI引用的三大核心条件——具体问题匹配、可验证数据密度、答案前置结构,并提供可复现的逐项检查法与落地执行框架。所有结论源于公开实测,读者可自行验证。

86 0
|
15天前
|
人工智能 算法
|

三阶段演进路径:AI搜索优化团队从外包验证到内部接管的完整机制拆解

本文基于6个月AI搜索优化实践,提出「外包验证→内部沉淀→数据决策」三阶段团队建设路径:探索期(0-3月)借外力验证可行性;过渡期(3-6月)内部人员深度参与、沉淀能力;成熟期(6月+)以数据驱动决策,实现策略自主与产能协同。含关键动作、避坑指南与可复现方法。

53 2
|
16天前
|
机器学习/深度学习 人工智能 自然语言处理
|

3阶段数据闭环:AI搜索优化从被引用到被选择的实测路径

本文基于普林斯顿大学2024年研究,揭示AI推荐转化率低的根源:重“引用次数”轻“引用语境”。提出90天数据闭环方法——重构指标(聚焦语境而非曝光)、A/B测试信息块结构、逆向分析引用场景、持续迭代优化。核心发现:信息闭环式内容提升引用率120%,推荐转化率才是唯一有效业务指标。

73 0
|
16天前
|
数据采集 人工智能 自然语言处理
|

3个衰减指标:AI搜索优化服务停摆后品牌消失机制与维护方案解析

本文基于普林斯顿与斯坦福最新研究,揭示AI搜索优化停摆后品牌可见度衰减的底层机制:LLM知识截止、RAG检索失效及实体关联弱化。提出可复现的“三指标+四步循环”维护方案,聚焦索引机制、信号衰减周期与内容供给节奏,助力品牌在生成式搜索中持续“被看见”。

59 0
|
16天前
|
数据采集 人工智能 监控
|

AI搜索优化机制解析:本地商家双引擎排队免单锁客模型

本文解析AI本地搜索推荐机制,揭示商家被AI引用的三大关键:结构化数据(NAP一致性)、权威引用源(.gov/.edu权重高3.2倍)、内容可验证性(嵌入真实数据提升引用率47%)。提出“排队免单”时间资产化方案,并构建AI推荐→到店转化→数据回流→复购增长的闭环体系。

113 0
|
18天前
|
人工智能 JSON 监控
|

6维度内容建设机制解析:从数据基线到引用率23%的演进路径

本文记录12周AI搜索优化实践,将品牌引用覆盖率从7%提升至23%。围绕认知、内容、技术、数据、权威、复盘六大维度,提供可复用的监控脚本、结构化内容重构案例及周度协同机制,所有策略均源自真实运行数据。

76 0
|
18天前
|
人工智能 自然语言处理 算法
|

6.02亿AI用户背后的内容分发迁移:家居行业被引用的四个关键信号

本文基于2026年对豆包、DeepSeek等四大AI引擎的800个家居行业词实测,揭示AI内容分发新逻辑:平台地图决定分发方向,信息块结构影响摘录率,数据锚点提升可信度,引用覆盖率衡量可见度。全文聚焦可复现方法,不讲投放,只讲机制。

98 0
|
18天前
|
人工智能 自然语言处理 监控
|

30天AI搜索优化执行计划:从答案库定位到引用率验证的完整路径

本文提出30天AI搜索优化路径:基于普林斯顿研究,聚焦“被AI直接引用”而非传统排名。通过四步闭环——建答案库、改存量内容、产对比/FAQ/数据页、搭引用监控,以结论明确、数据支撑、来源清晰为核心,提升内容在ChatGPT等引擎中的引用率。

89 1
|
19天前
|
数据采集 人工智能 搜索推荐
|

5个维度拆解:AI搜索引擎引用机制与百度收录的核心差异

本文剖析AI搜索“引用”机制,对比百度“收录”逻辑差异;基于豆包、DeepSeek实测,揭示内容被AI采纳的前提——需先获平台推荐权重,再经语义匹配被合成引用。提供平台地图绘制、分平台改写、信息块拆解三大可复现策略。

142 2
|
19天前
|
数据采集 人工智能 索引
|

三个高引用策略拆解:AI搜索优化内容预算的分配逻辑

本文基于普林斯顿大学AI搜索优化论文(arXiv:2311.09735),指出预算应聚焦内容编辑人力而非工具或外包。实测显示:引用来源(34.4%)、统计数据(32.1%)、直接引语(29.7%)三大策略贡献超96%引用提升,均需人工完成。提出调研→生产→监测三阶段预算模型,强调内容资产的长期累积价值。

56 1
我要发布