Flink之状态后端（StateBackends）-阿里云开发者社区

Flink之状态后端（StateBackends）

2022-05-18 1166

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 每传入一条数据，有状态的算子任务都会读取和更新状态。由于有效的状态访问对于处理数据的低延迟至关重要，因此每个并行任务(子任务)都会在本地维护其状态，以确保快速的状态访问。

每传入一条数据，有状态的算子任务都会读取和更新状态。由于有效的状态访问对于处理数据的低延迟至关重要，因此每个并行任务(子任务)都会在本地维护其状态，以确保快速的状态访问。

状态的存储、访问以及维护，由一个可插入的组件决定，这个组件就叫做状态后端（state backend）

状态后端主要负责两件事：

本地的状态管理

将检查点（checkpoint）状态写入远程存储

（1）状态后端的分类

状态后端作为一个可插入的组件, 没有固定的配置, 我们可以根据需要选择一个合适的状态后端。

Flink 提供了 3 中状态后端:

MemoryStateBackend

内存级别的状态后端

构造方法

env.setStateBackend(new MemoryStateBackend( "file://"+ 
baseCheckpointPath, null).configure(conf, classLoader))

数据存储

State 数据存储在TaskManager 内存中

Checkpoint 数据数据存储在jobManager 内存

容量限制

单词State maxStateSize默认为5M

maxStateSize <= akka.framesize默认10M

总大小不能超过JobMananger的内存

默认后端状态管理器

推荐场景:

本地测试

状态比较少的作业

不推荐生产环境中使用

特点：快速, 低延迟, 但不稳定

FsStateBackend

构造方法

env.setStateBackend(new FsStateBackend(tmpPath))

数据存储:

状态数据:TaskManager 内存

Checkpoint:外部文件系统（本地或HDFS）

容量限制:

单个TaskManager上State总量不能超过TM内存

总数据大小不超过文件系统容量

推荐场景:

常规状态作业

窗口时间比较长，如分钟级别窗口聚合，Join等

需要开启HA的作业

可在生产环境中使用

特点：拥有内存级别的本地访问速度, 和更好的容错保证

RocksDBStateBackend

将所有的状态序列化之后, 存入本地的 RocksDB 数据库中.(一种 NoSql 数据库, KV 形式存储)

创建方法

env.setStateBackend(new RocksDBStateBackend("file://"+
 basecheckpointPath).configure(conf,classLoader))

数据存储

State: TaskManager 中的KV数据库（实际使用内存+磁盘）

Checkpoint:外部文件系统（本地或HDFS）

容量限制:

单TaskManager 上 State总量不超过其内存+磁盘大小

单 Key最大容量2G

总大小不超过配置的文件系统容量

推荐场景:

超大状态作业

需要开启HA的作业

对状态读写性能要求不高的作业

生产环境可用

（2）配置状态后端

全局配置状态后端

在 flink-conf.yaml 文件中设置默认的全局后端

在代码中配置状态后端

可以在代码中单独为这个 Job 设置状态后端.

env.setStateBackend(new MemoryStateBackend());
env.setStateBackend(new FsStateBackend("hdfs://hadoop102:8020/flink/checkpoints/fs"));

如何要使用 RocksDBBackend, 需要先引入依赖:

<dependency>
  <groupId>org.apache.flink</groupId>
  <artifactId>flink-statebackend-rocksdb_${scala.binary.version}</artifactId>
  <version>${flink.version}</version>
  <scope>provided</scope>
</dependency>

env.setStateBackend(newRocksDBStateBackend("hdfs://hadoop102:8020/flink/checkpoints/rocksdb"));

相关实践学习

基于Hologres+Flink搭建GitHub实时数据大屏

通过使用Flink、Hologres构建实时数仓，并通过Hologres对接BI分析工具（以DataV为例），实现海量数据实时分析.

实时计算 Flink 实战课程

如何使用实时计算 Flink 搞定数据处理难题？实时计算 Flink 极客训练营产品、技术专家齐上阵，从开源 Flink功能介绍到实时计算 Flink 优势详解，现场实操，5天即可上手！欢迎开通实时计算 Flink 版： https://cn.aliyun.com/product/bigdata/sc Flink Forward Asia 介绍： Flink Forward 是由 Apache 官方授权，Apache Flink Community China 支持的会议，通过参会不仅可以了解到 Flink 社区的最新动态和发展计划，还可以了解到国内外一线大厂围绕 Flink 生态的生产实践经验，是 Flink 开发者和使用者不可错过的盛会。去年经过品牌升级后的 Flink Forward Asia 吸引了超过2000人线下参与，一举成为国内最大的 Apache 顶级项目会议。结合2020年的特殊情况，Flink Forward Asia 2020 将在12月26日以线上峰会的形式与大家见面。

Flink之状态后端（StateBackends）

（1）状态后端的分类

（2）配置状态后端

热门文章

最新文章

相关课程

相关电子书

相关实验场景

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

Flink之状态后端（StateBackends）

（1）状态后端的分类

（2）配置状态后端

热门文章

最新文章

相关课程

相关电子书

相关实验场景