【云计算与大数据计算】大数据物理、集成、安全架构及阿里云飞天系统架构讲解(超详细)

本文涉及的产品
对象存储 OSS,20GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
对象存储 OSS,内容安全 1000次 1年
简介: 【云计算与大数据计算】大数据物理、集成、安全架构及阿里云飞天系统架构讲解(超详细)

一、物理架构

物理架构 - 企业大数据系统的各层次系统最终要部署到主机节点中,这些节点通过网络连接成 为一个整体,为企业的大数据应用提供物理支撑 ,企业大数据系统由多个逻辑层组成,多个逻辑层可以映射到一个物理节点上,也可以映射到多个物理节点上

在映射时需要考虑三个方面的问题:一是是否容易识别,二是是否足够集约,三是是否能够同构

二、集成架构

集成架构 - 企业大数据系统由多个系统集成而成,每个系统都提供了多种协议和接口, 以便企业大数据系统的内部系统间集成和外部系统与大数据系统的集成

企业大数据系统的集成可以分为总体集成和专项集成,总体集成是指各组成系统间的集成,通过总体集成可以构成高校,可靠,安全运行的企业大数据系统,若企业大数据系统之外的某个应用系统或大数据系统之内的某个应用系统只想与存储系统,调度系统等进行集成,那么可通过调用这些系统开放的接口来实现,这种集成方式就是专项集成

三、安全架构

安全架构 - 由于企业大数据系统的数据资源和计算资源广泛地分布在多个节点上,所以用户的 身份、权限等安全,数据资源的存储、传输、访问等安全,以及计算资源的访问、监控、调整、恢复等安全,都是企业大数据系统在进行安全架构设计时需要考虑的问题

一般来讲,企业大数据的安全架构由针对三层的安全设计构成,这三层分别是用户层,应用层和数据层,针对每一层的关键行为加入安全因素的设计,以确保系统的整体安全

四、阿里云飞天系统体系架构

飞天(Apsara)是由阿里云自主研发、服务全球的超大规模通用计 算操作系统  

它可以将遍布全球的百万级服务器连成一台超级计算机、以在线公共服务的方式为社会提供计算能力  

7年过去,飞天已经为全球200多个国家和地区的创新创业企业、政府、机构等提供服务

阿里云飞天整体架构 - 飞天平台的体系架构如图所示,整个飞天平台包括飞天内核和飞天开发服务两大部分

飞天管理着互联网规模的基础设施。其最底层是遍布全球的几十个数据中心和数百个PoP节点

飞天内核跑在每个数据中心里面,它负责统一管理数据中心内的通用服务器集 群,调度集群的计算、存储资源,支撑分布式应用的部署和执行

安全管理根植在飞天内核最底层。飞天内核提供的授权机制能够有效实现“最小权限原则 (principle of least privilege)”,同时还建立了自主可控的全栈安全体系

监控报警诊断是飞天内核最基本的能力之一。飞天内核对上层应用提供了非常详细的、无间断的监控数据和系统事件采集

在基础公共模块之上有两个最核心的服务,一个叫盘古,一个叫伏羲

天基是飞天的自动化运维服务,负责飞天各个子系统的部署、升级、扩容以及故障迁移

阿里云飞天平台内核可以分成以下几个部分

分布式系统底层服务 - 其提供分布式环境下所需要的分布式协调服务、远程过程调用服务、安全管理、分布式资源调度等功能

盘古分布式文件系统 - 盘古(Pangu)是一个分布式文件系统, 盘古系统 的设计目标是将大量通用机器的存储资源聚合在一起,为用户提供大规模、高可靠、高可用、高吞吐量和可扩展的存储服务

伏羲任务调度系统 - 该系统为集群中的任务提供调度服务,同时支持强调响应速度的在线 服务(Online Service)和强调处理数据吞吐量的离线任务(Batch Processing Job)

集群监控和部署 - 神农(Shennong )是飞天平台内核中负责信息收集 、监控和诊断的模块,大禹 (Dayu)是飞天内核中负责提供配置管理和部署的模块

飞天开放服务

包括弹性计算 (ECS)、阿里云对象存储(OSS)、表格存储服 务(Table Store)、关系型数据库服务(RDS)、流式计算服务 (Stream Compute)和大数据计算服务(MaxCompute)等

弹性计算 (ECS) - 云服务器ECS(Elastic Compute Service)是一种云计算服务 , 它的管理方式比物理服务器更加简单、高效

阿里云对象存储(OSS) - 阿里云对象存储 (Object Storage Service, OSS)是阿里云对外提供的海量、安全、低成本、高可靠的云存储服务

表格存储 (Table Store) -  它是构建在阿里云飞天分布式系统之上的NoSQL数据存储服务,提供海量结构化数据的存储和实时访问

大数据计算服务(MaxCompute) - 大数据计算服务(MaxCompute,原名 ODPS)是一种快速、完全托管的TB/PB级数据仓库解决方案

阿里云飞天 OpenStack 和 Hadoop 的不同

OpenStack和 Hadoop是软件,它们并没有解决客户的CAPEX 投入问题、运维人员投入问题,需要部署到自有的硬件上,一般只用于单个企业的内部环境

飞天上面提供了基于 Hadoop、EMR、Mongo等开源软件的托管服务,这是飞天开放 能力的体现

阿里云飞天与 VMware 、华为 FusionSphere 的不同

虚拟化不等于云计算,云的实时在线、海量弹性、多租户隔离、专业运维都是传统虚拟化软件所欠缺的

VMware的三大件主要解决了计算的效率问题,但是没有解决计算的规模问题

华为的 FusionSphere 其实是基于开源软件进行定制并适配华为硬件的软件系统,飞天内核在规模、性能、稳定性和通用性上都超越了 FusionSphere

五、主流大数据厂商

Cloudera

Cloudera是一家专业从事基于Apache Hadoop的数据管理软 件销售和服务的公司 , 它发布的实时查询开源项目Impala比基于 MapReduce的HiveSQL的查询速度提升了3~90 倍

Hortonworks

Hortonworks的开放式互联平台帮助企业管理所拥有的数据(动态数据以及静态 数据),为用户组织启用可操作情报。

Amazon

Amazon 的 AWS 本身就是最完整的大数据平台, Amazon Web Services 提供了一系列广泛的服务,可以快速 、轻松地构建和部署大数据分析应用程序

Google

Google提出的 MapReduce计算框架在很多大数据领域得到了非常广泛的应用

微软

微软推出的商业数据分析系统 Microsoft Analytics Platform System 能够通过其扩充的大规模平行处理整合式系统支持混合格式的数据仓库,借此适应数据仓库环境不断发展的需求

阿里云数加平台

数加是阿里云为企业大数据的实施提供的一套完整的一站式大数据解决方案,

数加平台由大数据计算服务(MaxCompute)、分析型数据库(Analytic DB)、流计算 (StreamCompute)共同组成了底层强大的计算引擎, 速度更快, 成本更低  

创作不易 觉得有帮助请点赞关注收藏~~~

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
16天前
|
分布式计算 大数据 Apache
ClickHouse与大数据生态集成:Spark & Flink 实战
【10月更文挑战第26天】在当今这个数据爆炸的时代,能够高效地处理和分析海量数据成为了企业和组织提升竞争力的关键。作为一款高性能的列式数据库系统,ClickHouse 在大数据分析领域展现出了卓越的能力。然而,为了充分利用ClickHouse的优势,将其与现有的大数据处理框架(如Apache Spark和Apache Flink)进行集成变得尤为重要。本文将从我个人的角度出发,探讨如何通过这些技术的结合,实现对大规模数据的实时处理和分析。
48 2
ClickHouse与大数据生态集成:Spark & Flink 实战
|
1月前
|
SQL 存储 分布式计算
ODPS技术架构深度剖析与实战指南——从零开始掌握阿里巴巴大数据处理平台的核心要义与应用技巧
【10月更文挑战第9天】ODPS是阿里巴巴推出的大数据处理平台,支持海量数据的存储与计算,适用于数据仓库、数据挖掘等场景。其核心组件涵盖数据存储、计算引擎、任务调度、资源管理和用户界面,确保数据处理的稳定、安全与高效。通过创建项目、上传数据、编写SQL或MapReduce程序,用户可轻松完成复杂的数据处理任务。示例展示了如何使用ODPS SQL查询每个用户的最早登录时间。
90 1
|
1月前
|
分布式计算 资源调度 Hadoop
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
64 2
|
3月前
|
分布式计算 DataWorks 关系型数据库
MaxCompute 生态系统中的数据集成工具
【8月更文第31天】在大数据时代,数据集成对于构建高效的数据处理流水线至关重要。阿里云的 MaxCompute 是一个用于处理大规模数据集的服务平台,它提供了强大的计算能力和丰富的生态系统工具来帮助用户管理和处理数据。本文将详细介绍如何使用 DataWorks 这样的工具将 MaxCompute 整合到整个数据处理流程中,以便更有效地管理数据生命周期。
120 0
|
14天前
|
存储 人工智能 大数据
物联网、大数据、云计算、人工智能之间的关系
物联网、大数据、云计算、人工智能之间的关系是紧密相连、相互促进的。这四者既有各自独立的技术特征,又能在不同层面上相互融合,共同推动信息技术的发展和应用。
123 0
|
16天前
|
监控 安全 Cloud Native
云原生安全:Istio在微服务架构中的安全策略与实践
【10月更文挑战第26天】随着云计算的发展,云原生架构成为企业数字化转型的关键。微服务作为其核心组件,虽具备灵活性和可扩展性,但也带来安全挑战。Istio作为开源服务网格,通过双向TLS加密、细粒度访问控制和强大的审计监控功能,有效保障微服务间的通信安全,成为云原生安全的重要工具。
38 2
|
17天前
|
分布式计算 大数据 OLAP
AnalyticDB与大数据生态集成:Spark & Flink
【10月更文挑战第25天】在大数据时代,实时数据处理和分析变得越来越重要。AnalyticDB(ADB)是阿里云推出的一款完全托管的实时数据仓库服务,支持PB级数据的实时分析。为了充分发挥AnalyticDB的潜力,将其与大数据处理工具如Apache Spark和Apache Flink集成是非常必要的。本文将从我个人的角度出发,分享如何将AnalyticDB与Spark和Flink集成,构建端到端的大数据处理流水线,实现数据的实时分析和处理。
48 1
|
23天前
|
算法 大数据 数据库
云计算与大数据平台的数据库迁移与同步
本文详细介绍了云计算与大数据平台的数据库迁移与同步的核心概念、算法原理、具体操作步骤、数学模型公式、代码实例及未来发展趋势与挑战。涵盖全量与增量迁移、一致性与异步复制等内容,旨在帮助读者全面了解并应对相关技术挑战。
32 3
|
1月前
|
Kubernetes 安全 微服务
使用 Istio 缓解电信 5G IoT 微服务 Pod 架构的安全挑战
使用 Istio 缓解电信 5G IoT 微服务 Pod 架构的安全挑战
53 8
|
1月前
|
存储 消息中间件 druid
大数据-150 Apache Druid 安装部署 单机启动 系统架构
大数据-150 Apache Druid 安装部署 单机启动 系统架构
37 1