开发者社区> 问答> 正文

对于出现数据清晰的flink任务如何进行排查呢?

已解决

对于出现数据清晰的flink任务如何进行排查呢?

展开
收起
詹姆斯邦德00 2022-10-17 11:16:58 620 0
1 条回答
写回答
取消 提交回答
  • 推荐回答

    (1)数据源 source 消费不均匀

    解决思路:通过调整并发度,解决数据源消费不均匀或者数据源反压的情况。例如kafka数据源,可以调整 KafkaSource 的并发度解决消费不均匀。调整并发度的原则:KafkaSource 并发度与 kafka 分区数是一样的,或者 kafka 分区数是Kafka-Source 并发度的整数倍。

    (2)key 分布不均匀的无统计场景问题说明:key分布不均匀的无统计场景,例如上游数据分布不均匀,使用keyBy来打散数据。

    解决思路:通过添加随机前缀,打散 key 的分布,使得数据不会集中在几个Subtask。

    (3)GroupBy + Aggregation 分组聚合热点问题

    业务上通过 GroupBy 进行分组,然后紧跟一个 SUM、COUNT 等聚合操作是非常常见的。我们都知道 GroupBy 函数会根据 Key 进行分组,完全依赖 Key 的设计,如果 Key 出现热点,那么会导致巨大的 shuffle,相同 key 的数据会被发往同一个处理节点;如果某个 key 的数据量过大则会直接导致该节点成为计算瓶颈,引起反压。

    以上内容摘自《企业级云原生白皮书项目实战》电子书,点击https://developer.aliyun.com/ebook/download/7774可下载完整版

    2022-10-17 19:19:55
    赞同 展开评论 打赏
来源圈子
更多
收录在圈子:
阿里云开发者社区官方技术圈,用户产品功能发布、用户反馈收集等。
问答排行榜
最热
最新

相关电子书

更多
Flink CDC Meetup PPT - 龚中强 立即下载
Flink CDC Meetup PPT - 王赫 立即下载
Flink CDC Meetup PPT - 覃立辉 立即下载