知衣科技 × 阿里云:以MaxCompute 向量检索打通商品与海外社媒内容,让跨境选品看见真实热度

简介: 知衣科技联合阿里云,用MaxCompute向量检索替代Proxima,将跨境电商商品与海外社媒达人内容的图像匹配成本降低73% CPU、93%内存,实现千万级全量批式比对,助力商家以站外真实曝光驱动科学选品。

对跨境电商商家而言,一件商品在店铺内的销售数据是结果,而它在海外社媒上是否已被达人穿着、拍摄、发布,往往是更早出现的信号。要把这个信号用于选品决策,商家需要一个明确的答案:这件商品究竟出现在哪些达人的哪些内容中。
作为国内领先的时尚数据 AI 平台,知衣科技致力于推动 AI 与大数据技术在服装产业链的深度落地。公司围绕趋势发现、爆款挖掘与内容营销等核心场景,为服装企业提供全链路数智化解决方案,业务覆盖海内外,累计服务客户近万家,旗下拥有知衣、知款、抖衣、海外探款、FD+ 及知小衣等多元化数据智能 SaaS 与 AI 创新应用。

image.png

在面向跨境电商商家的服务中,知衣科技将上述需求定义为一项图像检索任务:把电商平台的商品图与海外知名社媒的达人图片分别转化为特征向量,通过批量相似度匹配建立两者的关联。方案的技术路径清晰,规模化落地则受制于检索环节的算力与成本。为此,知衣科技与阿里云大数据 AI 平台展开合作,将原有 Proxima 检索方案替换为 MaxCompute 提供的向量检索能力,在保留自研模型链路的前提下完成了检索环节的重构。

**一、业务诉求:从关键词检索到全量图像匹配

1.1 人工检索的覆盖面瓶颈**

在引入图像匹配能力之前,商家获取站外信息的主要方式是关键词检索加人工浏览:运营人员按品牌词、品类词在社媒平台逐条翻阅内容。这一方式的产出高度依赖人力投入,且覆盖范围由搜索结果决定——达人发布内容时若未提及品牌名称,相关内容便无法被发现;竞品监控的难度更高,商家往往无法预先确定检索词。海外达人内容池的规模在百万量级以上,人工抽样所能覆盖的比例十分有限。

1.2 图像匹配面临的三项工程挑战

图像主体定位。 达人发布的场景化图片中包含人物、背景与配饰,服装主体仅占画面的一部分;商品侧图片则多为白底图或模特图。两类图片直接计算相似度,结果易受非主体元素干扰。因此需先对两侧图片分别执行服装区域检测,裁剪出主体商品后再进入特征提取环节。
全量交叉匹配的算力压力。 单张图片的服装比对精度问题,知衣科技已通过自研 CV 模型解决。规模化落地的制约因素在检索侧:社媒侧博文覆盖多图,商品侧覆盖多个电商平台的主图与细节图,增量的商品需要和圈定达人的全量图片执行交叉比对。以一轮检索为例,商品侧约 1000 万条 512 维向量,需与约 200 万条社媒侧查询向量完成全量匹配。
检索成本决定业务覆盖边界。 受算力成本约束,含视频的内容目前仅提取首帧图像参与匹配。此类取舍在业务演进中将长期存在,检索环节的单位成本直接决定了可覆盖的内容池规模与数据更新频率。
三项挑战指向三个明确的技术诉求:一是具备承载全量批式向量检索能力的引擎;二是足够低的检索单位成本,以支撑天级全量重跑,避免在数据新鲜度与覆盖面之间取舍;三是能够与既有自研模型链路衔接,无需为迁移重写算法。

二、解决方案:MaxCompute 离线向量检索承接批量匹配
知衣科技与阿里云大数据 AI 平台共同梳理了数据处理链路,形成"自研模型负责理解、MaxCompute 负责检索"的分工。
image.png

2.1 数据清洗与图像预处理

海外知名社媒平台的公开博文内容经过集中清洗后,社媒图片与商品图分别执行服装区域检测(detect),裁剪出主体商品区域,排除人物、背景与配饰对后续特征提取的干扰。

2.2 特征向量生成:保留自研模型资产

裁剪后的图像由知衣科技自研 CV 模型完成打标与特征向量提取,模型自主训练、自主部署,运行在 GPU 集群上,知衣科技在服装识别领域积累的模型资产与调优经验得以完整保留。

2.3 批量向量检索:迁移至 MaxCompute

商品向量与社媒向量的批量相似度匹配在 MaxCompute 上完成,覆盖向量存储、索引构建与全量批式检索计算三个环节。原方案基于 MaxCompute 提供的 Proxima 引擎构建,需自行管理索引与检索集群,运维成本较高。迁移至新版向量检索后,上述环节由平台统一承接:向量数据本身已在 MaxCompute 内无需跨平台搬迁,只需写入新建的 VECTOR 类型列;外部模型生成 Embedding 的上游链路完全不变。检索语句切换为标准 VECTOR_SEARCH SQL 函数,索引由系统自动构建维护。知衣科技从验证到生产上线约两周完成切换,不再维护独立的向量检索基础设施,相同数据规模下资源消耗显著下降。
此外,博文正文中的品牌提及(如 @品牌名)作为辅助信号,用于确认部分特征明显的带货内容,匹配判断的主体仍为图像相似度。

三、应用场景:为选品决策补充站外依据

新的检索链路上线后,商家在知衣科技的产品中可以直接查看商品与达人内容的关联结果:自有商品出现在哪些达人的哪些内容中,竞品商品的站外曝光情况如何,热销商品背后是否存在 KOL 内容支撑。
这一信息进入选品环节后改变了判断依据。此前商家评估一个款式主要依赖站内销售数据,站外热度只能通过零散截图佐证;现在,一个款式是否已在海外社媒获得达人自发传播,成为可持续观测的指标。对备货决策而言,"站内数据良好"与"站内数据良好且站外已有达人内容"是两种不同强度的信号。

四、合作成效

在商品侧约 1000 万条、社媒侧约 200 万条 512 维向量的相同检索规模下,知衣科技对 MaxCompute 向量检索与原 Proxima 方案(历史版本)的资源消耗进行了对比。以 Proxima 最近 14 次运行的均值为基准,MaxCompute 离线向量检索的 CPU 消耗下降约 73%,内存消耗下降约 93%。

image.png

资源开销的大幅下降直接作用于业务:在相同预算下,同一轮全量匹配可以覆盖更大的内容池,或以更高频率重跑,使商家看到的商品-达人关联结果保持在更新的状态。检索环节不再是内容池规模与数据新鲜度之间的取舍点。

对于这次合作解决的核心问题,知衣科技技术团队有更直接的感悟:
"商品图与海外社媒内容的全量匹配,是我们很早就想做的事,真正的瓶颈在检索成本——原有方案下,数据规模和算力成本只能二选一。与阿里云大数据平台 的这次合作,把大规模批量向量检索交给了平台,让我们能把精力集中在服装款式特征向量的提取能力上。双方团队围绕索引构建与批式检索做了多轮联合调优,CPU 与内存消耗分别下降约 73% 和 93%,检索环节的成本压力得到明显缓解。接下来,我们希望把这套能力延伸到更多电商平台和更大规模的社媒图片,让站外真实热度成为跨境选品的常规指标。"
—— 知衣科技技术负责人

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
弹性计算 分布式计算 MaxCompute
华北1 ECS 数据如何免费且高速同步到华北2MaxCompute
用户业务早期开在了华北1青岛,想搭数据仓库,但华北1又没有MaxCompute,怎么办?如果华北1 ECS跨Region数据同步到华北2MaxCompute,是否产生额外的带宽费用和同步性能差? 今天小编亲自测试下华北1 ECS 通过经典网络数据同步到华北2MaxCompute,打消大家对费用和性能的担心。
2815 110
华北1 ECS 数据如何免费且高速同步到华北2MaxCompute
|
存储 分布式计算 大数据
阿里云计算能力实现多项突破 BigBench规模全球首次被拓展至100TB
10月12日,阿里巴巴集团副总裁周靖人在云栖大会上发布了阿里云在大数据计算能力上的新突破:将BigBench数据规模扩展到100T;流计算2.0每秒峰值达千万QPS,整体链路延时亚秒级;E-MapReduce对比同类产品平均性能提升3倍。
3963 110
|
存储 监控 关系型数据库
MaxCompute帮助创业公司中减轻MySQL存储压力
从0到1 在我们公司初创的时候,组齐了三人的团队就开始做产品研发。当时整条业务线的东西都需要我们自己写,要在短时间内把东西做出来,效率是非常关键的。 我们的产品模式本身其实是需要验证的。创业有很多不确定性,在上线之前没人能知道,我们的一个项目究竟能达到多大的规模,能做到什么样。
3874 110
|
机器学习/深度学习 分布式计算 语音技术
重磅!MaxCompute助力阿里开源自研语音识别模型DFSMN,准确率高达96.04%
阿里开源语音识别模型DFSMN 在近期举行的云栖大会武汉峰会上,装有DFSMN语音识别模型的“AI收银员”在与真人店员的PK中,在嘈杂环境下准确识别了用户的语音点单,在短短49秒内点了34杯咖啡。此外,装备这一语音识别技术的自动售票机也已在上海地铁“上岗”。
3924 110
|
新零售 机器学习/深度学习 算法
千亿特征流式学习在大规模推荐排序场景的应用
摘要:2017云栖大会机器学习平台PAI专场,阿里巴巴高级技术专家陈绪带来千亿特征流式学习在大规模推荐排序场景的应用的演讲。主要从电商个性化推荐开始谈起,进而描述了技术挑战和PAI解决方案,重点分享了鲲鹏框架和算法调优,最好作了简要总结。
6397 110
|
弹性计算 分布式计算 Hadoop
[大数据新手上路]“零基础”系列课程--如何将ECS上的Hadoop数据迁移到阿里云数加·MaxCompute
 想用阿里云数加·大数据计算服务(MaxCompute),但是现在数据还在hadoop上,怎么办?   别烦恼,跟着我们走,来一次MaxCompute零基础数据迁移之旅~Let’s Go!
19142 111
|
分布式计算 大数据 MaxCompute
中国唯一,阿里云进入Forrester大数据服务榜单
日前,全球权威调研机构Forrester发布《2018年一季度云端数据仓库》报告。报告对大数据服务商的主要功能、区域表现、细分市场和典型客户等进行了全面评估,最终AWS、阿里云、Google、微软四大巨头杀入全球一线阵营。
6553 110
|
存储 分布式计算 算法
|
分布式计算 DataWorks Java
[MaxCompute MapReduce实践]通过简单瘦身,解决Dataworks 10M文件限制问题
用户在DataWorks上执行MapReduce作业的时候,文件大于10M的JAR和资源文件不能上传到Dataworks,导致无法使用调度去定期执行MapReduce作业。 解决方案: jar -resources test_mr.
3834 110

热门文章

最新文章