《阿里云认证的解析与实战-数据仓库ACP认证》——云原生数据仓库AnalyticDB MySQL版解析与实践(上)——二、产品架构及原理

简介: 《阿里云认证的解析与实战-数据仓库ACP认证》——云原生数据仓库AnalyticDB MySQL版解析与实践(上)——二、产品架构及原理

1. 产品架构

 

AnalyticDB MySQL版采用云原生架构,计算存储分离、冷热数据分离,支持高吞吐实时写入和数据强一致,兼顾高并发查询和大吞吐批处理的混合负载。其产品架构包括接入层、计算引擎、存储引擎。

 

image.png

 

• 接入层:协议层接入、SQL解析和优化、数据和查询调度。

• 计算引擎:

ü 支持高并发和复杂SQL混合负载,采用DAG和MPP支持不同负载。

ü 弹性调度,可根据业务需求做到分钟级甚至秒级扩展,实现了资源的有效利用。

• 存储引擎:

ü 分布式实时强一致高可用存储引擎。

ü 利用分层存储实现冷热分离降低成本。

ü 通过行列存储和智能索引提升性能100%。

 

2. 优化器介绍

 

优化器包括四个部分:统计层、代价估计层、优化器层、缓存层,其功能分别如下:

 

• 统计信息:提供多样的统计信息;提供自动的统计信息收集;提供动态采样。

• 代价预估和代价模型。

• 基于规则的RBO框架和基于代价的CBO框架。

• 通过缓存来提供优化器的高效性,可介入、可运维。

 

image.png

 

3. 弹性计算层

 

image.png

弹性计算层架构图

 

如上图,计算引擎采用弹性计算引擎,支持资源组隔离、弹性扩容、2000多个工作站、大规模ETL、混合负载、分时弹性等。

 

1) 查询执行计划

 

 语句

 

select count() from customer left join lineitem on customer.c nationkey=lineitem.l_partkey;

 

逻辑执行计划:用户下发SQL,前端节点负责解析SQL,生成分布式执行计划,下发到计算节点和存储节点执行,执行完成后,将结果返回给前端节点。

 

image.png

 

ADB中SQL执行主要概念有如下三个:

 

• Stage:为了让Query能够在多台机器上并行执行,会将执行计划拆分成多个阶段(Stage),每个Stage会产生多个Task进行执行。

• Task:负责具体计算的执行,是Stage在某一个Worker或者Executor上的实例。

• Operator:对应一个相对独立的计算单位,比如过滤、投影、聚合等操作,作用于输入数据,并产生输出。

 

2) 查询执行模式

 

a) Interactive模式

 

• 场景:适合交互式查询,对响应时间有较高要求,查询Query不高,资源充足。

• 特点:MPP pipeline方式执行,即一个查询的所有分布式执行任务会被同时调度执行,完全基于内存进行计算,大查询消耗资源多。

 

b) Batch模式(E系列支持)

 

• 场景:适合ETL场景,作业执行时间长,对RT要求低,计算数据量大,计算逻辑复杂,但资源较为有限。

• 特点:

ü BSP方式执行,即StageByStage方式调度执行分布式任务。

ü 内存不足时自适应下盘算子状态数据。

ü Stage之间的数据传输(Exchage/Shuffle)依赖本地磁盘和对象存储。

ü 大查询/ETL离线任务资源消耗可控。

 

4. 存储层

 

image.png

存储层架构图

 

在存储层架构中,ADB MySQL支持实时任务的在线存储和离线任务的离线存储。在线存储通过异步更新的方式进入到离线存储,同时这两种存储会通过storage SDK的方式对外提供统一的存储接口。

 

image.png

 

1) 高吞吐写入

 

AnalyticDB存储层具有高吞吐写入的特点,采用玄武分析存储引擎,为用户提供高可靠、高可用、高性能、低成本的企业级数据存储能力,是AnalyticDB实现高吞吐实时写入、高性能实时查询的基础支撑。

 

image.png

 

 

2) 高可用

 

AnalyticDB在存储层使用Raft协议,在多副本之间保障数据的一致性,同时具有高可靠、高可用性,当Worker Group副本失效时,Raft协议通过多数派保证系统的正常运行。增量数据是通过异步构建的方式加载到全量数据,实现了冷热数据的分层以及数据的分级管理。

 

image.png

 

3) 行列混合存储

 

• 存储层是行列混合存储,玄武存储引擎支持行列混存和行存的存储格式,其中行列混存是一种以列存为基础兼顾行存的模式,类似于Hadoop中的ORC/Parquet格式。

 

• 不同的是,玄武的行列混存不仅兼顾分析类的列裁剪和大吞吐扫描性能,而且结合其行对齐的能力,可以实现很好的随机查找性能,这对于任意多维索引过滤的场景也拥有出色的性能优势。

 

4) 自适应索引

 

存储层采用自适应索引,加快数据的检索。 

image.png

 

如图,在执行该sql时,条件“id=123”、“ts between and”会建立BKD索引,条件“NOT”采用Invert索引,“json_extract”采用JSON处理,“name like ‘bob%’”采用全表扫描scan模式,对于不同条件下产生的结果,通过联合或并的操作产生Row Ids的集合,最后通过Row Ids集合获取最终数据。

相关实践学习
阿里云云原生数据仓库AnalyticDB MySQL版 使用教程
云原生数据仓库AnalyticDB MySQL版是一种支持高并发低延时查询的新一代云原生数据仓库,高度兼容MySQL协议以及SQL:92、SQL:99、SQL:2003标准,可以对海量数据进行即时的多维分析透视和业务探索,快速构建企业云上数据仓库。 了解产品 https://www.aliyun.com/product/ApsaraDB/ads
相关文章
|
人工智能 关系型数据库 OLAP
光云科技 X AnalyticDB:构建 AI 时代下的云原生企业级数仓
AnalyticDB承载了光云海量数据的实时在线分析,为各个业务线的商家提供了丝滑的数据服务,实时物化视图、租户资源隔离、冷热分离等企业级特性,很好的解决了SaaS场景下的业务痛点,也平衡了成本。同时也基于通义+AnalyticDB研发了企业级智能客服、智能导购等行业解决方案,借助大模型和云计算为商家赋能。
1187 17
|
前端开发 JavaScript 关系型数据库
如何开发生产小工单中的产品管理板块(附架构图+流程图+代码参考)
生产小工单中的产品管理板块是制造业数字化管理的关键环节,涵盖产品信息、生产工序、产品列表和基础设置四大功能模块。通过系统化管理,企业可实现对产品属性、工艺流程及资源配置的精准控制,提升生产效率并减少误差与浪费。本文详解了各功能模块的设计逻辑、业务流程及开发实现方案,并提供示例代码,助力企业构建高效、灵活的产品管理系统。
|
Cloud Native Serverless API
微服务架构实战指南:从单体应用到云原生的蜕变之路
🌟蒋星熠Jaxonic,代码为舟的星际旅人。深耕微服务架构,擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验,探索技术演进的无限可能。
1025 4
微服务架构实战指南:从单体应用到云原生的蜕变之路
|
关系型数据库 MySQL 分布式数据库
阿里云PolarDB云原生数据库收费价格:MySQL和PostgreSQL详细介绍
阿里云PolarDB兼容MySQL、PostgreSQL及Oracle语法,支持集中式与分布式架构。标准版2核4G年费1116元起,企业版最高性能达4核16G,支持HTAP与多级高可用,广泛应用于金融、政务、互联网等领域,TCO成本降低50%。
|
Java API 开发工具
灵码产品演示:软件工程架构分析
本演示展示灵码对复杂软件项目的架构分析与文档生成能力。通过Qwen3模型,结合PlantUML,自动生成系统架构图、微服务时序图,并提取API接口文档,实现高效、智能的代码理解与文档输出。
693 5
|
监控 关系型数据库 MySQL
DTS实时同步进阶:MySQL到AnalyticDB毫秒级ETL管道搭建
本方案采用“Binlog解析-数据清洗-批量写入”三级流水线架构,实现MySQL到AnalyticDB的高效同步。通过状态机解析、内存格式转换与向量化写入技术,保障毫秒级延迟(P99<300ms)、50万+ TPS吞吐及99.99%数据一致性,支持高并发、低延迟的数据实时处理场景。
472 10
|
前端开发 NoSQL 关系型数据库
如何开发CRM系统中的产品管理板块(附架构图+流程图+代码参考)
本文深入解析了CRM系统中产品管理模块的设计与实现,涵盖系统架构、业务流程、核心代码及落地建议,助力企业构建高效的产品管理体系。
|
人工智能 自然语言处理 供应链
AI时代企业难以明确大模型价值,AI产品经理如何绘制一张‘看得懂、讲得通、落得下’的AI产品架构图解决这一问题?
本文产品专家系统阐述了AI产品经理如何绘制高效实用的AI产品架构图。从明确企业六大职能切入,通过三层架构设计实现技术到业务的精准转译。重点解析了各职能模块的AI应用场景、通用场景及核心底层能力,并强调建立"需求-反馈"闭环机制。AI产品专家三桥君为AI产品经理提供了将大模型能力转化为商业价值的系统方法论,助力企业实现AI技术的业务落地与价值最大化。
770 0
|
机器学习/深度学习 数据可视化 PyTorch
深入解析图神经网络注意力机制:数学原理与可视化实现
本文深入解析了图神经网络(GNNs)中自注意力机制的内部运作原理,通过可视化和数学推导揭示其工作机制。文章采用“位置-转移图”概念框架,并使用NumPy实现代码示例,逐步拆解自注意力层的计算过程。文中详细展示了从节点特征矩阵、邻接矩阵到生成注意力权重的具体步骤,并通过四个类(GAL1至GAL4)模拟了整个计算流程。最终,结合实际PyTorch Geometric库中的代码,对比分析了核心逻辑,为理解GNN自注意力机制提供了清晰的学习路径。
1058 7
深入解析图神经网络注意力机制:数学原理与可视化实现
|
机器学习/深度学习 缓存 自然语言处理
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
Tiktokenizer 是一款现代分词工具,旨在高效、智能地将文本转换为机器可处理的离散单元(token)。它不仅超越了传统的空格分割和正则表达式匹配方法,还结合了上下文感知能力,适应复杂语言结构。Tiktokenizer 的核心特性包括自适应 token 分割、高效编码能力和出色的可扩展性,使其适用于从聊天机器人到大规模文本分析等多种应用场景。通过模块化设计,Tiktokenizer 确保了代码的可重用性和维护性,并在分词精度、处理效率和灵活性方面表现出色。此外,它支持多语言处理、表情符号识别和领域特定文本处理,能够应对各种复杂的文本输入需求。
1755 6
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构

推荐镜像

更多