哔哩哔哩基于阿里云PolarDB与通义千问构建全域内容洞察新框架

简介: 哔哩哔哩联合阿里云PolarDB for AI,构建“大模型+小模型”协同的全域内容洞察框架:在保障隐私前提下,对去标识化互动数据进行结构化分析,精准识别品牌、类目、属性及用户反馈倾向,助力广告主科学评估种草效果、优化营销策略,提升商业决策确定性。

通过阿里云 PolarDB 数据库,我们首次实现了对平台全域公开互动数据的高效结构化处理。在严格遵循隐私保护原则、所有数据均经过去标识化、匿名化处理的前提下,系统可对群体层面的反馈趋势进行分析,辅助品牌更科学地评估内容传播效果,并为营销策略优化提供数据支撑,提升商业决策的确定性。

——强朔 哔哩哔哩资深数据科学家

一、客户背景

哔哩哔哩(B站)是国内领先的文化社区和视频平台。平台内容生态高度多元化,涵盖视频、图文、直播、音频、互动内容、搜索、动态等多种体裁。作为以“内容种草”为核心心智的平台,B站已成为品牌营销的重要阵地,尤其在汽车、3C数码、美妆、快消、教育培训、游戏等行业具备显著影响力。


二、业务场景与核心痛点

与传统电商平台不同,B站用户的消费决策往往源于内容互动所形成的品牌认知与兴趣积累,而非站内直接转化。这一特点对营销效果评估提出了更高要求。为此,平台基于经过去标识化、匿名化处理的海量公开互动数据,开展群体层面的数据趋势分析,以支持内容生态优化与商业服务能力的持续提升。例如,通过分析洞察辅助评估品牌内容的传播广度与用户反馈方向,为广告主提供更科学的效果参考。

1.png

B站内容平台营销商业化路径

B站商业化团队在服务品牌客户过程中,面临三大核心挑战:


1. 营销效果难以量化:品牌在B站投放内容(如UP主种草视频)后,缺乏有效手段衡量用户群体是否被“种草”。例如,某汽车品牌发布新车测评视频后,需从去标识化的互动内容中识别用户群体对续航、外观、价格等属性的评价,以评估内容传播效果。


2. 内容资产难以结构化:B站内容体裁丰富、语义复杂,视频中包含大量视觉、语音、文本信息,互动区则充斥高信息密度的长文本。传统关键词匹配或规则引擎难以准确提取商业实体(如品牌、类目、SPU)及其关联语义。


3. 营销策略缺乏数据支撑:品牌希望基于B站真实讨论内容,反向指导新品定义、传播策略与创意方向。例如,某美妆品牌需了解用户群体在讨论粉底液时最关注“持妆度”“遮瑕力”还是“肤感”,但缺乏系统性内容洞察工具。为解决上述问题,B站商业化数据科学团队联合阿里云,构建了一套面向全域内容的结构化洞察框架,实现从“内容感知”到“商业洞察”的数据闭环。


三、解决方案:“大模型+小模型”协同的全域内容洞察新框架

PolarDB for AI 是阿里云瑶池旗下云原生数据库PolarDB内部的分布式机器学习组件,支持在数据不出库的前提下,高效调用轻量化小模型进行实时推理,同时可联动千问等大模型处理复杂语义任务,实现大模型与小模型协同一体化架构。

2.png

PolarDB for AI一站式方案

  • PolarDB for AI 可以通过调用千问大模型,对经过去标识化、匿名化处理的用户互动内容进行批量分析,辅助洞察群体层面的兴趣趋势与反馈倾向,为产品优化与内容策略提供数据支持。
  • PolarDB for AI通过定制化的电商领域大模型,结合阿里电商领域的商品知识图谱,大大提升B站对类目、品牌、SPU等多个标签的识别能力,实现品牌高精准匹配,促进内容资产结构化。

3.png

B站全域内容洞察矩阵


B站采用“大模型+小模型”融合的技术路径,依托DeepSeek、阿里千问(Qwen)系列大模型、B站自研的Index模型与PolarDB for AI能力,构建覆盖M×N矩阵的全域内容洞察体系——M为商业化标签维度,N为内容体裁维度。整体技术架构分为三层:

  • AI基建层:基于阿里云百炼平台、PAI、GPU资源及B站自研Agent平台,提供模型训练、推理与调度能力。
  • 数据与模型层:结合通用大模型(如Qwen、Qwen-VL、Qwen-Audio)与PolarDB for AI提供的领域小模型(经SFT、强化学习微调),实现高效、低成本的内容洞察。
  • 应用服务层:通过PolarDB for AI节点,提供模型算子能力,实现“数据不出库”的高效挂靠与推理,且提供稳定独享的模型实时在线服务能力。


该方案兼顾效果与成本:通用大模型用于标签体系挖掘与复杂语义分析,领域小模型则在特定任务(如实体抽取)上实现更高精度与更低延迟。


四、关键技术实现与难点突破

1. 视频稿件内容提取:从非结构化到结构化

4.png

视频内容提取过程

视频是B站核心内容载体,但其信息分散于画面、语音与字幕中。B站采用多模态融合策略:

  • 中间层构建:通过ASR(语音转文本)与关键帧OCR(图像文字识别)提取原始文本,再利用Qwen-VL、Qwen-Audio等多模态大模型生成语义中间表示。
  • CPV体系构建:基于大模型挖掘与行业维护,建立“类目-属性-属性值”体系。例如,识别出视频中“相机”类目下的“防抖技术”属性及其值“IBIS”。
  • 实体三元组抽取与挂靠:通过大模型抽取<类目, 品牌, SPU>三元组,但原始抽取结果存在与标准产品库里的命名不一致的问题(如“尼康Z5” vs “尼康Z5微单相机”)。


技术难点:如何将非标准化抽取结果精准挂靠至标准产品库?


解决方案:B站与阿里云PolarDB团队合作,在PolarDB for AI节点中部署定制化挂靠模型。通过SQL,在数据库内直接调用精调后的大模型进行实体对齐。例如,我们来预测一个稿件的类目。执行如下SQL:

/*polar4ai*/ 
SELECT * FROM PREDICT(
  MODEL _polar4ai_cpv_agent, 
  SELECT '{"商品名称":"尼康Z5","品牌名称":"尼康","类目属性模板":{"类目":""},"类目属性限定":{"类目":["数码-摄影摄像-传统相机-相机","数码-数码配件",...]}}'
) WITH ();


得到{"类目":"数码-摄影摄像-传统相机-相机"}该方案实现“数据不出库”的高并发挂靠,解决抽取结果与标准产品命名的一致性问题,既保障数据安全,又显著降低工程复杂度。同时,结合BGE+RoBERTa等NLP模型进行匹配,进一步提升挂靠准确率。


2. 互动内容分析:从海量数据中挖掘高价值线索

5.png

互动内容分析过程

B站评论区信息密度很高,但90%以上为非商业化内容。直接使用大模型全量处理成本高昂。


技术难点:如何在成本可控的前提下,利用匿名化互动数据实现多实体群体反馈的细粒度分析,支撑内容与商业服务的持续优化?


解决方案:采用“过滤-分析-挖掘”三级流水线:

  • 第一级:商业化过滤:使用轻量级NLP模型,如BGE+BiLSTM模型快速筛除无关内容,仅保留可能涉及品牌、产品讨论的内容。
  • 第二级:实体与予以关联分析:对过滤后文本,利用PolarDB for AI提供的商品大模型识别类目、品牌、SPU,并建立不同实体间的语义关联关系。
  • 第三级:意图与属性挖掘:进一步识别“种草”“购买意愿”等高阶语义,并提取用户群体关注的具体属性(如“续航达成率高”“价格贵”),形成结构化洞察。


五、总结

通过与阿里千问大模型及PolarDB for AI的深度协同,B站成功构建了一套高效、可扩展的全域内容洞察体系。该体系不仅解决了品牌营销效果度量难、内容资产结构化难等核心痛点,更将B站独特的社区公开互动数据转化为可行动的商业洞察,显著提升了广告主的投放确定性与ROI。目前,该全域内容洞察体系已应用于B站的哔哩指数、花火平台AI选UP主、哔哩必达洞察报告、引力计划爆文投放、经营号线索挖掘及品牌广告搜索词包等商业化场景,实现从内容洞察到营销转化的全链路提效。未来,B站将持续优化模型能力,拓展至更多内容体裁与商业场景,进一步释放内容平台的营销价值。

目录
相关文章
|
SQL 存储 物联网
基于 LLM 的知识图谱另类实践
大语言模型时代,我们有了 few-shot 和 zero-shot 的能力。借助这些 LLM 能力,如何更便捷地实现知识图谱的知识抽取,用知识图谱来解决相关问题。
1165 1
基于 LLM 的知识图谱另类实践
|
18天前
|
SQL AliSQL 关系型数据库
AliSQL 新版本发布:DuckDB、VIDX、Native Flashback 与事务优化
AliSQL 8.0.44-2 正式发布:基于 MySQL 8.0.44,集成 DuckDB v1.4.4 分析引擎,新增原生向量索引 VIDX、Native Flashback、Persist Binlog Into Redo 及 Binlog Cache Free Flush,全面提升分析性能与 AI 原生能力。
125 0
|
自然语言处理 机器人 API
GitHub开源史上最大规模中文知识图谱
GitHub开源史上最大规模中文知识图谱
GitHub开源史上最大规模中文知识图谱
|
30天前
|
人工智能 IDE 数据处理
2026年Vibe Coding系统学习指南:从入门到实战全路径
IDC 2025全球AI编程工具报告显示,Vibe Coding(氛围编程)已成为开发者效率提升的核心路径,62%的技术团队已将其纳入日常开发流程。传统编程学习需数月掌握语法、框架与调试逻辑,而Vibe Coding以自然语言交互为核心,大幅降低入门门槛,但缺乏系统学习方法易陷入“只会描述、不会把控”的误区。本文以PySpark数据处理Pipeline为实战场景,结合TRAE、Cursor、Claude Code等主流工具,从基础认知、工具选型、提示词工程、实战迭代到工程化落地,构建完整学习体系,帮助开发者快速掌握Vibe Coding核心能力。
321 2
|
30天前
|
人工智能 JavaScript 安全
2026年企业级AI编程助手选型:中小团队协作全方案
本文聚焦2026年中小技术团队AI编程助手选型,基于GitHub Octoverse与信通院报告,剖析TRAE、Cursor、Claude Code、Copilot、文心快码在团队协作、TS/Node.js适配、工程化落地及数据安全四大维度的差异,提供实战示例与分步落地指南。(239字)
|
23天前
|
Web App开发 数据采集 人工智能
|
22天前
|
人工智能 IDE API
阿里云百炼Coding Plan详细介绍:是什么、收费价格、支持模型和AI工具
阿里云百炼Coding Plan是面向开发者的AI编码专属订阅套餐,Lite基础版已全面停售,当前仅Pro高级版支持新购与续费。新用户可享首月200元限时特惠,采用固定月费模式,整合通义千问、Kimi、GLM等多款大模型,兼容Cursor、Qwen Code等数十款主流AI编程工具。产品采用5小时滚动、周度、月度多层级额度恢复机制,月度最高9万次请求,单位调用成本远低于普通按量计费。该套餐仅限交互式编码场景使用,严禁后端自动化调用,适合个人日常写代码;若涉及团队协作或生产级API集成,更推荐搭配Token Plan团队版使用。
|
11月前
|
弹性计算 监控 CDN
阿里云CDN如何设置云监控报警规则?
通过云监控为CDN域名设置报警规则,实时监控流量、状态码等指标,异常时及时告警,助力快速定位与处理问题,保障服务稳定。
'webpack-dev-server' 不是内部或外部命令,也不是可运行 的程序 或批处理文件。
'webpack-dev-server' 不是内部或外部命令,也不是可运行 的程序 或批处理文件。
579 0