【行业应用】阿里云实时计算 Flink 版内容资讯解决方案

本文涉及的产品
实时计算 Flink 版,1000CU*H 3个月
简介: 在日益激烈的行业竞争态势下,各个主流内容资讯提供商都在探索 AI+大数据的解决方案,来进行精细化运营,助力业务发展新模式

行业挑战

2017 年 6 月,PC 端的新闻资讯月度覆盖人数达到 4.8 亿(在 PC 网民中的渗透率同比上升 1.8% 至 90.1%);移动端新闻资讯服务月覆盖独立设备数达到 6.2 亿,同比增长 34.8%(在移动网民中的渗透率同比上升 10.5% 至 55.5%)。

因此,移动端互联网使得获取资讯服务的门槛和成本都大大降低,也使得用户的资讯消费行为更频繁和多元化。虽然移动网络新闻行业渗透率仍然较低(55.5%),但市场整体增速较快(2017 年月覆盖人数同比增长 34.8%,渗透率同比增长 10.5%),发展潜能巨大。

移动内容资讯行业已进入下半场,**精细化运营是主调。

  1. 伴随着移动流量增长,门户网站先后推出了移动客户端,同时,一些聚合类资讯平台也开始出现在移动端。
  2. 移动新闻资讯用户增多,市场力量显现,为了寻求差异化优势,各平台纷纷探索直播、短视频、语音等多元内容输出形式,同时结合个性化推荐提升运营效率;在这个阶段,传统新闻机构也开始了移动化布局。
  3. 在技术的加持下,移动新闻资讯行业获得了资本关注,竞争趋势明显,各大平台都开始通过打造自媒体生态和富媒体内容布局来提高产品壁垒。
  4. 伴随着行业热度的持续发酵,精细化运营将成为移动新闻资讯行业下半场的主调。一方面,平台的内容价值将显现;另一方面,技术迭代将成为平台新鲜活力的来源。

因此,在日益激烈的行业竞争态势下,各个主流内容资讯提供商都在探索 AI+大数据的解决方案,来进行精细化运营,助力业务发展新模式,从业务需求上来讲,在大数据方面遇到的挑战如下:

  1. 数据量大,增速迅猛:主流内容分享平台在新增用户数、日均 UV/PV 等核心指标上,产品初期每年都会有翻倍的增长。
  2. 业务形态复杂:大量内容分享产品的母公司都在探索新的内容输出方式,如新闻类、短视频类、直播类等。各种业务形态差异大,对平台的通用化要求高。
  3. 实时性要求高:内容分享平台的核心系统有个性化推荐、广告计费、风控等业务,业务上要实现精细化运营,对数据的实时性要求更高。

解决方案

1 内容.jpg

在内容资讯行业,实时计算 Flink 版的典型使用场景:

  1. 实时数仓:数据 ETL 及实时指标计算,Flink Batch 提供异构数据源互导功能。Flink SQL,大大简化计算模型,降低用户使用 Flink 的门槛。
  2. 实时机器学习平台:实时特征处理,样本拼接,为下游机器学习模型训练准备数据。
  3. 实时风控和实时安全:Flink CEP 提供基于 Event 的规则配置功能,简单易上手。
  4. 广告系统:广告平台实时数仓建设,广告实时计费系统以及广告算法部分的数据预处理。
  5. 运营团队:活动运营监控,如实时监控红包发放状态来调整发放策略。

成功案例

字节跳动

客户简介

北京字节跳动科技有限公司成立于 2012 年 3 月,是最早将人工智能应用于移动互联网场景的科技企业之一。公司以建设“全球创作与交流平台”为愿景,是目前国内最大的内容分享平台,其应用程序包括:

  • 今日头条
  • 抖音短视频(抖音短视频火山版)
  • Tiktok
  • 西瓜视频
  • 懂车帝

分布于多个行业领域,发展势头非常迅猛。

业务需求

在字节跳动内部,实时计算的使用场景:

  1. 实时数仓:

    1. 用户行为日志清洗和解析
    2. 用 Flink SQL 构建实时数仓,实时指标计算
    3. 使用 Flink Batch 进行异构数据源导入导出
  2. 风控和安全团队:

    1. 使用 Flink CEP 进行规则判断
  3. 机器学习

    1. 数据预处理
    2. 正负样本拼接
    3. 模型训练的资源调度
  4. 广告:

    1. 广告算法部分使用场景包括数据预处理、样本拼接
    2. 广告平台,使用 Flink 构建实时数仓
  5. 视频团队

    1. 实时指标监控系统
    2. 运营活动监控(控制红包发放等)

技术架构

2.jpg

业务结果

字节跳动引入 Flink 已经有3年时间,支持了核心业务的实时需求,目前字节跳动内部 Flink 应用规模:

  • 5+ Yarn 集群,机器规模达到 10000+
  • 作业数 2000+
  • 用户 300+
  • 支持数十个产品,包括今日头条,抖音,火山小视频等核心产品

未来展望

Flink 在字节跳动数据处理链路的作用将会越来越大,为了更好的支持各类业务方,未来我们对 Flink 的规划:

  1. Flink Streaming:推动 Flink 作业 Docker 化,支持 Flink Job 横向扩展
  2. Flink SQL:

    1. 未来一年,推动 Flink SQL 任务达到 50%
    2. 探索 Streaming/Batch 新的使用场景
  3. Flink Batch:

    1. 推测执行,提升稳定性
    2. Flink Gelly 支持全图离线计算应用场景

实时计算 Flink 版产品交流群

test

阿里云实时计算Flink - 解决方案:
https://developer.aliyun.com/article/765097
阿里云实时计算Flink - 场景案例:
https://ververica.cn/corporate-practice
阿里云实时计算Flink - 产品详情页:
https://www.aliyun.com/product/bigdata/product/sc

相关实践学习
基于Hologres+Flink搭建GitHub实时数据大屏
通过使用Flink、Hologres构建实时数仓,并通过Hologres对接BI分析工具(以DataV为例),实现海量数据实时分析.
实时计算 Flink 实战课程
如何使用实时计算 Flink 搞定数据处理难题?实时计算 Flink 极客训练营产品、技术专家齐上阵,从开源 Flink功能介绍到实时计算 Flink 优势详解,现场实操,5天即可上手! 欢迎开通实时计算 Flink 版: https://cn.aliyun.com/product/bigdata/sc Flink Forward Asia 介绍: Flink Forward 是由 Apache 官方授权,Apache Flink Community China 支持的会议,通过参会不仅可以了解到 Flink 社区的最新动态和发展计划,还可以了解到国内外一线大厂围绕 Flink 生态的生产实践经验,是 Flink 开发者和使用者不可错过的盛会。 去年经过品牌升级后的 Flink Forward Asia 吸引了超过2000人线下参与,一举成为国内最大的 Apache 顶级项目会议。结合2020年的特殊情况,Flink Forward Asia 2020 将在12月26日以线上峰会的形式与大家见面。
相关文章
|
6月前
|
存储 缓存 数据挖掘
Flink + Doris 实时湖仓解决方案
本文整理自SelectDB技术副总裁陈明雨在Flink Forward Asia 2024的分享,聚焦Apache Doris与湖仓一体解决方案。内容涵盖三部分:一是介绍Apache Doris,一款高性能实时分析数据库,支持多场景应用;二是基于Doris、Flink和Paimon的湖仓解决方案,解决批流融合与数据一致性挑战;三是Doris社区生态及云原生发展,包括存算分离架构与600多位贡献者的活跃社区。文章深入探讨了Doris在性能、易用性及场景支持上的优势,并展示了其在多维分析、日志分析和湖仓分析中的实际应用案例。
474 17
Flink + Doris 实时湖仓解决方案
|
6月前
|
存储 运维 监控
阿里妈妈基于 Flink+Paimon 的 Lakehouse 应用实践
本文总结了阿里妈妈数据技术专家陈亮在Flink Forward Asia 2024大会上的分享,围绕广告业务背景、架构设计及湖仓方案演进展开。内容涵盖广告生态运作、实时数仓挑战与优化,以及基于Paimon的湖仓方案优势。通过分层设计与技术优化,实现业务交付周期缩短30%以上,资源开销降低40%,并大幅提升系统稳定性和运营效率。文章还介绍了阿里云实时计算Flink版的免费试用活动,助力企业探索实时计算与湖仓一体化解决方案。
779 3
阿里妈妈基于 Flink+Paimon 的 Lakehouse 应用实践
|
7月前
|
存储 关系型数据库 MySQL
Flink基于Paimon的实时湖仓解决方案的演进
本文整理自阿里云智能集团苏轩楠老师在Flink Forward Asia 2024论坛的分享,涵盖流式湖仓架构的背景介绍、技术演进和未来发展规划。背景部分介绍了ODS、DWD、DWS三层数据架构及关键组件Flink与Paimon的作用;技术演进讨论了全量与增量数据处理优化、宽表构建及Compaction操作的改进;发展规划则展望了Range Partition、Materialized Table等新功能的应用前景。通过这些优化,系统不仅简化了复杂度,还提升了实时与离线处理的灵活性和效率。
714 3
Flink基于Paimon的实时湖仓解决方案的演进
|
6月前
|
SQL 弹性计算 DataWorks
Flink CDC 在阿里云 DataWorks 数据集成入湖场景的应用实践
Flink CDC 在阿里云 DataWorks 数据集成入湖场景的应用实践
250 6
|
6月前
|
存储 关系型数据库 MySQL
Flink基于Paimon的实时湖仓解决方案的演进
Flink基于Paimon的实时湖仓解决方案的演进
180 0
|
8月前
|
消息中间件 关系型数据库 MySQL
Flink CDC 在阿里云实时计算Flink版的云上实践
本文整理自阿里云高级开发工程师阮航在Flink Forward Asia 2024的分享,重点介绍了Flink CDC与实时计算Flink的集成、CDC YAML的核心功能及应用场景。主要内容包括:Flink CDC的发展及其在流批数据处理中的作用;CDC YAML支持的同步链路、Transform和Route功能、丰富的监控指标;典型应用场景如整库同步、Binlog原始数据同步、分库分表同步等;并通过两个Demo展示了MySQL整库同步到Paimon和Binlog同步到Kafka的过程。最后,介绍了未来规划,如脏数据处理、数据限流及扩展数据源支持。
525 0
Flink CDC 在阿里云实时计算Flink版的云上实践
|
12月前
|
运维 数据处理 数据安全/隐私保护
阿里云实时计算Flink版测评报告
该测评报告详细介绍了阿里云实时计算Flink版在用户行为分析与标签画像中的应用实践,展示了其毫秒级的数据处理能力和高效的开发流程。报告还全面评测了该服务在稳定性、性能、开发运维及安全性方面的卓越表现,并对比自建Flink集群的优势。最后,报告评估了其成本效益,强调了其灵活扩展性和高投资回报率,适合各类实时数据处理需求。
|
10月前
|
存储 分布式计算 流计算
实时计算 Flash – 兼容 Flink 的新一代向量化流计算引擎
本文介绍了阿里云开源大数据团队在实时计算领域的最新成果——向量化流计算引擎Flash。文章主要内容包括:Apache Flink 成为业界流计算标准、Flash 核心技术解读、性能测试数据以及在阿里巴巴集团的落地效果。Flash 是一款完全兼容 Apache Flink 的新一代流计算引擎,通过向量化技术和 C++ 实现,大幅提升了性能和成本效益。
3146 73
实时计算 Flash – 兼容 Flink 的新一代向量化流计算引擎
zdl
|
10月前
|
消息中间件 运维 大数据
大数据实时计算产品的对比测评:实时计算Flink版 VS 自建Flink集群
本文介绍了实时计算Flink版与自建Flink集群的对比,涵盖部署成本、性能表现、易用性和企业级能力等方面。实时计算Flink版作为全托管服务,显著降低了运维成本,提供了强大的集成能力和弹性扩展,特别适合中小型团队和业务波动大的场景。文中还提出了改进建议,并探讨了与其他产品的联动可能性。总结指出,实时计算Flink版在简化运维、降低成本和提升易用性方面表现出色,是大数据实时计算的优选方案。
zdl
409 56

热门文章

最新文章

相关产品

  • 实时计算 Flink版