Flink批处理优化器之数据属性

简介: 在一段时间之前我们已介绍过IP(Interesting Property)对于优化器的意义以及它将对优化器的优化决策产生的影响。本篇我们将介绍Flink的批处理优化器中涉及到的所有的IP,我们将其统称为数据属性。

在一段时间之前我们已介绍过IP(Interesting Property)对于优化器的意义以及它将对优化器的优化决策产生的影响。本篇我们将介绍Flink的批处理优化器中涉及到的所有的IP,我们将其统称为数据属性。后续我们会介绍Flink如何为优化器节点计算IP,并在之后的“剪枝”(pruning)阶段发挥作用。

数据属性

数据属性是个统称,来自于Flink优化器模块定义的子包名:dataproperties,需要注意的是这里属性的含义不是代码实现层面上类里的属性,而是指代对优化器的优化决策产生影响的一种指标。所以这里的属性对应到代码中的类。总体而言,有两类属性:

  • 本地属性:用于表述对本地处理的任务(如,排序)产生影响的属性;
  • 全局属性:用于表述对跨分区的数据传输(如,广播、哈希分区等)产生影响的属性;

再结合是否不可或缺,又可进一步细分为:

  • LocalProperties:本地属性;
  • GlobalProperties:全局属性;
  • RequestedLocalProperties:必不可少的本地属性,是本地属性的子集,一旦缺少会导致对程序错误地优化并返回错误的结果;
  • RequestedGlobalProperties:必不可少的全局属性,是全局属性的子集,一旦缺少会导致对程序错误地优化并返回错误的结果;

另外的两个额外的属性:

  • InterestingProperties:它就是我们常说的IP,是一个属性容器类,包含了一系列的RequestedLocalProperties和RequestedGlobalProperties集合。IP将直接对优化器寻找最优计划产生影响,它将会从父运算符传递给子运算符(以sink为顶点的倒置的遍历树),并告知子运算符哪些属性可以帮助它获得最廉价的执行方案。例如,一个Reduce运算符,将告诉其子运算符分区信息,如果子运算符是join,那么它将根据获得的信息,保留数据分区形式并选择更合适的执行策略。
  • PartitioningProperty:分区属性,枚举了所有被支持的分区类型;

以上这些属性类之间的关联关系如下图所示:

接下来我们会对以上这些属性类中的关键字段进行解读。

  • LocalProperties
属性 类型 描述
ordering(*) Ordering 一个分区内部的排序方式
groupedFields(*) FieldList 用于分组的字段集
uniqueFields Set<FieldSet> 在合并时值唯一的字段

* GlobalProperties

属性 类型 描述
partitioning(*) PartitioningProperty 表示分区类型的属性
partitioningFields(*) FieldList 分区的字段
ordering(*) Ordering 如果分区方式为范围分区,该字段表示分区字段的排序顺序
uniqueFieldCombinations Set<FieldSet> 在合并时值唯一的字段
customPartitioner(*) Partitioner<?> 当partitioning指定为CUSTOM_PARTITIONING时,使用的分区器
distribution(*) DataDistribution 数据分布对象,当分区类型为RANCE_PARTITION时需要设置

上面两个表格中,被标记为”*”的属性,就是RequestedLocalProperties和RequestedGlobalProperties中的属性。

而InterestingProperties由RequestedLocalProperties以及RequestedGlobalProperties属性集合组成:

属性 类型 描述
localProps Set<RequestedLocalProperties> 必备的本地属性集合
globalProps Set<RequestedGlobalProperties> 必备的全局属性集合

PartitioningProperty类枚举了跨分区或并行工作节点之间数据的shuffle形式:

  • ANY_DISTRIBUTION:任何可能的数据分布形式,包括随机分区和完全复制;
  • RANDOM_PARTITION:一种随机性的非复制型的数据分布方式;
  • HASH_PARTITION:基于给定键的哈希分区方式;
  • RANGE_PARTITION:基于特定键的范围分区方式;
  • ANY_PARTITIONING:不在键上指定明确的分区方式;
  • FULL_REPLICATION:将数据完全复制到每个并行的实例上去;
  • FORCED_REBALANCED:强制重平衡,尽量保证每个分区上数据记录的均等;
  • CUSTOM_PARTITIONING:自定义分区,可通过分区器(Partitioner)指定;

对于这些枚举值,哪些是事实上真正意义的分区呢?PartitioningProperty提供了一个isPartitioned方法来进行判断:

public boolean isPartitioned() { 
    return this != FULL_REPLICATION && this != FORCED_REBALANCED && this != ANY_DISTRIBUTION; 
}

从代码段中可见,非FULL_REPLICATION、非FORCED_REBALANCED以及非ANY_DISTRIBUTION,其余的都被认为是真正意义上的分区。


原文发布时间为:2017-04-09
本文作者:vinoYang
本文来自云栖社区合作伙伴 CSDN博客,了解相关信息可以关注CSDN博客。
相关实践学习
基于Hologres+Flink搭建GitHub实时数据大屏
通过使用Flink、Hologres构建实时数仓,并通过Hologres对接BI分析工具(以DataV为例),实现海量数据实时分析.
实时计算 Flink 实战课程
如何使用实时计算 Flink 搞定数据处理难题?实时计算 Flink 极客训练营产品、技术专家齐上阵,从开源 Flink功能介绍到实时计算 Flink 优势详解,现场实操,5天即可上手! 欢迎开通实时计算 Flink 版: https://cn.aliyun.com/product/bigdata/sc Flink Forward Asia 介绍: Flink Forward 是由 Apache 官方授权,Apache Flink Community China 支持的会议,通过参会不仅可以了解到 Flink 社区的最新动态和发展计划,还可以了解到国内外一线大厂围绕 Flink 生态的生产实践经验,是 Flink 开发者和使用者不可错过的盛会。 去年经过品牌升级后的 Flink Forward Asia 吸引了超过2000人线下参与,一举成为国内最大的 Apache 顶级项目会议。结合2020年的特殊情况,Flink Forward Asia 2020 将在12月26日以线上峰会的形式与大家见面。
目录
相关文章
|
12月前
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
简介:本文整理自阿里云高级技术专家李麟在Flink Forward Asia 2025新加坡站的分享,介绍了Flink 2.1 SQL在实时数据处理与AI融合方面的关键进展,包括AI函数集成、Join优化及未来发展方向,助力构建高效实时AI管道。
1305 43
|
12月前
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
本文整理自阿里云的高级技术专家、Apache Flink PMC 成员李麟老师在 Flink Forward Asia 2025 新加坡[1]站 —— 实时 AI 专场中的分享。将带来关于 Flink 2.1 版本中 SQL 在实时数据处理和 AI 方面进展的话题。
657 0
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
|
存储 消息中间件 Kafka
基于 Flink 的中国电信星海时空数据多引擎实时改造
本文整理自中国电信集团大数据架构师李新虎老师在Flink Forward Asia 2024的分享,围绕星海时空智能系统展开,涵盖四个核心部分:时空数据现状、实时场景多引擎化、典型应用及未来展望。系统日处理8000亿条数据,具备亚米级定位能力,通过Flink多引擎架构解决数据膨胀与响应时效等问题,优化资源利用并提升计算效率。应用场景包括运动状态识别、个体行为分析和群智感知,未来将推进湖仓一体改造与三维时空服务体系建设,助力数字化转型与智慧城市建设。
1191 3
基于 Flink 的中国电信星海时空数据多引擎实时改造
|
SQL 算法 调度
Flink批处理自适应执行计划优化
本文整理自阿里集团高级开发工程师孙夏在Flink Forward Asia 2024的分享,聚焦Flink自适应逻辑执行计划与Join算子优化。内容涵盖自适应批处理调度器、动态逻辑执行计划、自适应Broadcast Hash Join及Join倾斜优化等技术细节,并展望未来改进方向,如支持更多场景和智能优化策略。文章还介绍了Flink UI调整及性能优化措施,为批处理任务提供更高效、灵活的解决方案。
706 0
Flink批处理自适应执行计划优化
|
12月前
|
SQL 关系型数据库 Apache
从 Flink 到 Doris 的实时数据写入实践 —— 基于 Flink CDC 构建更实时高效的数据集成链路
本文将深入解析 Flink-Doris-Connector 三大典型场景中的设计与实现,并结合 Flink CDC 详细介绍了整库同步的解决方案,助力构建更加高效、稳定的实时数据处理体系。
3947 0
从 Flink 到 Doris 的实时数据写入实践 —— 基于 Flink CDC 构建更实时高效的数据集成链路
|
存储 消息中间件 搜索推荐
京东零售基于Flink的推荐系统智能数据体系
摘要:本文整理自京东零售技术专家张颖老师,在 Flink Forward Asia 2024 生产实践(二)专场中的分享,介绍了基于Flink构建的推荐系统数据,以及Flink智能体系带来的智能服务功能。内容分为以下六个部分: 推荐系统架构 索引 样本 特征 可解释 指标 Tips:关注「公众号」回复 FFA 2024 查看会后资料~
747 1
京东零售基于Flink的推荐系统智能数据体系
|
Oracle 关系型数据库 Java
【YashanDB知识库】Flink CDC实时同步Oracle数据到崖山
本文介绍通过Flink CDC实现Oracle数据实时同步至崖山数据库(YashanDB)的方法,支持全量与增量同步,并涵盖新增、修改和删除的DML操作。内容包括环境准备(如JDK、Flink版本等)、Oracle日志归档启用、用户权限配置、增量日志记录设置、元数据迁移、Flink安装与配置、生成Flink SQL文件、Streampark部署,以及创建和启动实时同步任务的具体步骤。适合需要跨数据库实时同步方案的技术人员参考。
【YashanDB知识库】Flink CDC实时同步Oracle数据到崖山
|
Java 关系型数据库 MySQL
SpringBoot 通过集成 Flink CDC 来实时追踪 MySql 数据变动
通过详细的步骤和示例代码,您可以在 SpringBoot 项目中成功集成 Flink CDC,并实时追踪 MySQL 数据库的变动。
3659 45
|
存储 监控 数据处理
flink 向doris 数据库写入数据时出现背压如何排查?
本文介绍了如何确定和解决Flink任务向Doris数据库写入数据时遇到的背压问题。首先通过Flink Web UI和性能指标监控识别背压,然后从Doris数据库性能、网络连接稳定性、Flink任务数据处理逻辑及资源配置等方面排查原因,并通过分析相关日志进一步定位问题。
1295 61
|
消息中间件 关系型数据库 Kafka
阿里云基于 Flink CDC 的现代数据栈云上实践
阿里云基于 Flink CDC 的现代数据栈云上实践
390 1

热门文章

最新文章