云原生实时数仓-AtomData结合阿里云分布式存储实现海量数据分析(一)
嘉宾信息
王博
杭州石原子科技AtomData技术负责人
AtomData结合阿里云分布式存储实现海量数据分析(一)
内容介绍
一、 AtomData产品定位
二、 AtomData产品架构
三、 AtomData三大优势
四、AtomData产品特点
五、AtomData的技术架构
六、 适用场景
七、 高弹性、高性能海量数据存储方案
八、 适配阿里云分布式存储收益
九、AtomData 23年路标
研究背景:
我是石原子科技公司的技术负责人王博,研究的是技术的架构和适用的场景,包括如何云阐述分析场景下的优势。
一、AtomData产品定位
第一个,我们产品的定位在常规的大数据,我们一般把数仓分为三层,第一层是处理层,它一般是由hadoop和这种大数据的存储和计算组件的产能,他承担着主数据的存储和计算功能,另外还分为负责对于速度的存取,包括一些实时数据的实数据的存储和更新,还分为了服务层,它负责对于企业在实时数据查询的需求,一般是由和es来承接,对这这种三层架构的这种大数据体系来说,整个架构是比较复杂的,它的灵活性和它的这个实施的敏捷度是比较低的。一般来说是t加一的模式,做好之后,把数据导入到那层去,做数据的支持的服务,生命层一般有多种数据库可以用户去,比如,可以去处理场景下面的数据的多分析的问题,去处理k的数据结构的点的问题,去做了基于画像的分析,这种多维多维度的数据报表聚合的查询,对于这种复杂的大数据体系,可以作为大数据体系上面的服务层的这种解决方案能够去实时的,去实时的去存储用户的实时写入的数据和实时更新的数据,能够实时的为企业去做查询和分析,还可以去作为数据库去同时替换,包括速度,服务在用户体量在pb级别到p级别以内,在他没有非常强的这种结构处理处理需求的时候的业务逻辑相对比较简单的时候,以通过替换掉层去做数据离线数据的处理和加工塔,Mysql和双写的,它可以用mysql协议去接入用户的数据的需求,数据需求也可以利用大数据计算框架去利用协议去接入数据库,去做大规模的数据计算。
另外,它还可以支持纯算耦合的式分部署方式,这两种方式可以针对两种用户场景,在用户在用户的数据存储和数据计算需求比较固定的情况下,它可以用存上耦合的方式去部署数据库,去做数据的存储和计算。
当用户的数据存储需求和计算需求是浮动的时候,它可以用存算分离的方式去部署,利用新的能力去应对存算和计算的不同时段的需求。
另外,它还可以支持结构化和数据的存储,存储和分析,支持时空的数据,支持从到p级的数据的分析和存储需求景架构。
二、AtomData产品架构
我们可以把它点燃的分为几块,从底层的就设施来看,它适配了业界主流的,配了主流的一些国产的一些操作系统,也适配了阿里云,华为云,腾讯云之类的这种云平台,从核心组件来看,它分成引擎层,任务管理层和通信协议层,在引擎层,我们有自己的列表引擎以及外表引擎。外表引擎,可以去连接像os hfql短的外表引擎,
是我们一个纯引擎,我们后面讲解会详细的讲到,这种管理层,包括可以去管理数据上的数据的采样,包括离线作业的这个调度,包括构建的一些管理和资源的一些管理,在通协议层,我们支持mysl协议,企业级特性里面我们做了蛮多的功课,包括我们可以用户可以去支持自定义的这个副数量,以及去对接以对接分布式文件存储,这储设已经去支持,可以去实现层的这个高可用,包括我们可以在前面去前置一个,负展均衡,去实现r c阶层的连接,连接的均衡包括可以支持量的以及增量的这种实施备份包括说容同层。另外我我们做了一个可视化的一套界面,帮助用户去更好的去管理,运维它的的集群可视化管理,今天我们可做库表级别的管理,这个对标一般常见的系统可以去做管理,数据库的管理以及用户的管理,包括可以通过我们的可视化理工具做数据恢复,以常规常规运维和巡高塔具有明显的优势。
三、AtomData三大优势
第一个是复杂分析能力比较强,另外一个块是他的性价比较高,我们的整体的部署集群和部署组件来说是比较紧凑的,不需要投入过多的外部,不需要投入的过多的工程师。
另外,同时具备能力使得数据加工的过程比较短,整个仓的建设周期比较短,另外产品是比较维护,综合成本比较低,另外一个特是使用我们是兼q,l协议的所有的标准的数据库连接工具,数据库管理工具,包括数据的抽取,加工,调度以及di的工具都可以很轻易的连接到我们数据库。支持对多种的数据源,包括我们有深度的配了hs os以及myq,这我们都支持,另外就是由我们的金融mysql生态,所以说上下游的这个生态,上下游工具我们接的比较多,像常见的工具我们都是有兼容的。