2022云栖精选—Lindrom多模融合: 让海量数据存得起,看得见

简介: 张为阿里巴巴集团研究员/NoSQL产品部负责人

lQLPJxbcF2cqNBvMiM0FeLCMz4ifcSGHeANpqgFLAEAA_1400_136.pngimage.png

过去20多年,互联网电商业务数据经历了快速增长,从传统处理结构化数据的OLTP数据库时代过渡到处理海量半结构化、非结构化数据的互联网业务平台新时代。新时代对大容量、高性能、低成本的海量数据处理平台的需求急速增长。

针对阿里巴巴电商业务,尤其是双十一数据海量增长和快速处理分析的需求,阿里巴巴开始自研数据库技术。2009年,Tair1.0内存数据库上线,支撑了电商交易的核心企业场景,在数十亿的QPS峰值下时延保持亚毫秒级别;2011年,Lindorm1.0数据库平台上线,支撑了阿里巴巴全系列业务在线大数据场景,在百PB存储下保持毫秒访问和极致低成本。

今天,随着网络技术进步以及对传感器技术的深入使用,各行各业数字化推进使得海量大数据的生产呈现出与以往更不一样的特征,同时对于高性能、低成本、大容量NoSQL数据库系统需求增加。

因此,阿里巴巴将诞生于电商互联网平台的大数据技术,以LindormTair为代表,结合阿里云上计算环境,推出一系列云上NoSQL数据库产品。2019年,阿里云与MongoDB强强联手,推出云上文档数据库;2020年,自研海量多模数据库Lindorm在阿里云正式上线;2022年,自研内存数据库Tair在阿里云正式上线。

image.png

 

Lindorm的诞生记录了数据库针对时代场景的挑战和变迁。

70年代开始,数据库的技术发展经历了三个阶段,第一个阶段以关系型数据库为代表,主要支撑企业和政府的关键业务数据。以处理结构化数据为主,处理的级别在GB级别,OracleDB2MySQL等都是常见的关系数据库产品。

2000年开始,随着互联网技术的发展,更多的业务对数据的管理和分析提出不一样的挑战。日志和文档等不同类型数据的产生,使得存储和处理半结构化数据、非结构化数据的非关系型数据库蓬勃发展,BigtableMongoDBRedisElasticSearch等都是非关系型数据库的典型代表,数据生产达到TB级别。

当下,随着万物数字化和各类传感器飞速发展,IDC预测到2025年全世界90%的数据将是以传感器生产的IoT数据为主。该数据的类型丰富多样,包括各式各样的传感器数据,例如图片、声音、GPS等,数据量可达到EB级别。因此,需要能够融合处理海量异构数据,并且提供极致低成本的原生多模数据库,这就是Lindorm诞生的原因。

image.png


Lindorm具备三个特性:

第一:Lindorm是一种多模超融合的数据,云原生地支持各种异构数据类型,包括半结构化和非结构化数据,如宽表、时序、时空等。Lindorm存储多种异构数据的同时,还能实现数据的在线分析和在线检索,向用户提供统一SQL接口。

第二:性能和成本的极致平衡。Lindorm是云原生的数据模型,它是典型的存储计算分离架构,可以让存储和计算事件实现独立弹性伸缩。Lindorm可无缝集成多种不同类型的存储,如对象存储、云盘存储、本地物理盘存储,还能综合管理不同类型存储服务的IO、性能及成本。针对海量数据在Lindorm的存储,Lindorm通过对数据冷热进行识别和分离,将不同级别的数据自适应到不同类型的存储上。以上特性让Lindorm实现高性能的同时降低了成本。

第三:Lindorm具备开源生态兼容的特性,可全面兼容各种开源体系,用户可零成本适配,支持HBaseCassandraOpenTSDBS3HDFSKafka等多种接口,使云下的大数据负载低成本、无缝地迁移至云上的多模数据库生态。


image.png

Lindorm多模融合架构分为三层。

第一层为存储融合主要解决海量数据在云原生大数据环境下存储效率问题,能够将云上存储能力无缝融合,降低用户对海量数据的管理和存储成本。针对新时代产生海量数据,Lindorm作为云原生模数据库,能够无缝地帮助用户管理多种不同层级存储介质,包括本地盘云盘云上对象存储等,用户可以将多种存储介质无缝呈现在一个存储池里,可根据特性自动多种异构数据分配到不同存储介质上。

同时Lindorm完全云原生的分布式文件系统作为底座,能够独立弹性扩缩存储容量。我们将不同存储介质能力Lindorm数据的负载做了自动适配,能够在不同级别上支持高效压缩与编码。比如,可以通过纠删码EC算法,将副本冗余系数降低至1.25,可以根据自适应压缩算法,最小化数据的存储。

image.png

第二层为结构融合。

用户在管理多组异构IoT或者万物互联网数据时,能够无缝地将多种异构数据通过一个平台系统进行管理,从而解决运维效率复杂度的问题。比如针对时序、时空数据,用户往往需要采用不同大数据系统针对每种负载独立构建数据服务在应用层将多种数据服务交互进行统一管理。Lindorm提供了灵活表格模型,比如Lindorm宽表既能支持传统关系型数据库Schema结构化数据,也可以通过增加动态链,向文档灵活增加Schema结构数据。宽表类型模型之外,Lindorm还支持多种其他异构数据存储引擎,比如支持JSON实时读取与处理,支持时序数据的融合分析,以及支持非结构化数据  Blob类型存储调用

通过将多种异构数据在一个数据库系统进行综合管理用户将无需分别构建多种数据库系统,大幅降低了用户对于海量异构数据运维管理成本,简化了用户系统架构。

image.png

第三层为多种负载计算融合,解决用户在处理分析多种异构数据时需要综合运用到多种计算能力以及开发复杂系统应用问题。

通过Lindorm底下内置多种数据分析引擎,比如传统Lindorm宽表引擎数据搜索引擎时空分析引擎批量离线计算引擎等分别处理不同类型异构数据同时无缝拉齐各种数据链路,使得异构数据可以流转被引擎拉起的多种异构数据进行融合分析。

传统开发模式需要构建多个数据服务,需要与多个数据服务器进行复杂交互,通过Lindorm SQL引擎,用户只需Lindorm一个系统打交道,极大简化开发数据应用成本,大幅提高开发效率。

image.png

Lindorm能够融合多种特性云上存储介质,能够智能识别用户在不同的负载里冷热数据的访问模式。Lindorm能够智能识别用户对于冷热数据的需求,将不同的冷热数据分散到不同存储介质上。可以用快速压缩算法将热数据存储到高性能存储介质上,经过智能识别以后可以实现冷热数据的转换,将数据进行深度压缩,最大化降低用户存储成本同时最大化用户的性能。

以上一切工作均在存储引擎内部完成用户无需手动分别处理冷数据与热数据。

image.png

Lindorm实现了SearchIndex加速检索分析。

数据写入以后进入宽表引擎用户只需经过简单配置,即可启动Lindorm搜索引擎,用户写入数据创建全量与增量索引用户无需再额外构建一套搜索服务,也无需将数据流转,可以在内部完成全局内容检索,大幅简化了用户应用开发流程。

 

image.png

物联网时代最典型应用是车联网数据,无数汽车无时无刻不在向车联网数据中心上传车机数据包括车辆运行状态时空位置车辆摄头以及雷达数据,数据量极大并且具有明显的异构特征而我们可以通过Lindorm提供的不同引擎,在同一个系统中处理与分析不同类型的车联网数据,大幅简化车联网应用的开发流程,开发、运维的效率均有大幅提升。

image.png

可观测场景下的数据包括tracingloggingmetrics等几种不同类型,传统方式下,我们需要使用不同的数据处理系统针对几种不同类型数据进行处理,比如tarcing需要使用宽表数据库,logging使用搜索引擎,metrics使用时序数据库。而有了Lindorm后,通过一个系统即可对三种数据统一进行融合管理与处理并且无需区分三种系统,无需使用三种不同接口与语言交互,只需统一使用SQL即可一站式完成监测场景应用开发。

image.png

Lindorm提供了HBase平滑迁移方案。通过高速数据通道LTS能够将客户已经建立HBase集群双向同步与迁移至云上Lindorm数据库。并且Lindorm支持使用HBase客户端或Lindorm客户端无缝访问迁移到Lindorm的数据,且存储成本降低50%,性能吞吐提高300%

lQLPJxbcF2cqM2TM-M0CnrCgW_7LDpyh1wNpqgFKAPsA_670_248.png

相关文章
|
2月前
|
人工智能 运维 监控
AI Agent开发平台的技术架构探索与功能设计
2026年,企业级AI Agent市场规模预计达449亿元,但仍有60%的企业停留在试点阶段——规模化落地的核心障碍并非模型能力,而是可观测性、管控粒度与层级治理的缺失。 本文从技术架构视角出发,对比分析了Dify、Coze、LangChain及主流云厂商平台在监控深度、管控粒度、编排耦合、层级抽象和声明式管理五个维度的共性不足。 在此基础上,我们提出并实践了一套七层递进式治理架构(工具库→Skill→工作流→Agent→编排→项目→安全策略),实现了六层穿透式监控能力——成本可从项目逐级下钻到单次工具调用,解决了“钱花在哪、谁花的、值不值”的核心问题。同时支持可视化拖拽与声明式YAML双
512 1
|
8月前
|
存储 人工智能 搜索推荐
不懂向量数据库?别怕!一文讲清8大主流工具,手把手教你做选择
向量数据库是AI应用的“超级记忆中枢”,能将文本、图像等转化为数学指纹并快速检索相似内容。本文通俗解析8大主流向量数据库,涵盖托管型、开源型与嵌入式三类,助你根据场景选型,轻松构建智能搜索、推荐系统与RAG应用。
5609 6
|
NoSQL 关系型数据库 MySQL
开源数据库
【8月更文挑战第26天】开源数据库
707 11
|
存储 人工智能 数据处理
Flink Forward Asia 2025 主旨演讲精彩回顾
Flink Forward Asia 2025 在新加坡开幕,聚焦实时数据与 AI 融合。Apache Flink 推出新子项目 Flink Agents,支持系统触发的 AI Agent 应用,提升实时处理能力。Flink 2.0 实现存算分离,迈向云原生架构。Paimon 支持多模态数据存储,Fluss 成为面向 AI 的流表存储系统。大会展现 Flink 生态全面拥抱 AI 的未来方向。
1021 1
Flink Forward Asia 2025 主旨演讲精彩回顾
|
监控 安全 Linux
AlmaLinux 9.6 正式版发布 - RHEL 二进制兼容免费发行版
AlmaLinux 9.6 正式版发布 - RHEL 二进制兼容免费发行版
660 0
AlmaLinux 9.6 正式版发布 - RHEL 二进制兼容免费发行版
|
人工智能 分布式计算 数据处理
Big Data for AI实践:面向AI大模型开发和应用的大规模数据处理套件
文叙述的 Big Data for AI 最佳实践,基于阿里云人工智能平台PAI、MaxCompute自研分布式计算框架MaxFrame、Data-Juicer等产品和工具,实现了大模型数据采集、清洗、增强及合成大模型数据的全链路,解决企业级大模型开发应用场景的数据处理难题。
|
存储 SQL 数据管理
Data Fabric:一站式数据管理与服务
在2023年11月01日云栖大会D区D2-1进行了主题为阿里云瑶池数据库如何助力企业数字化转型与升级的演讲,本文带大家一起了解阿里云数据库生态工具产品部负责人周文超的精彩演讲,内容为《Date Fabric:一站式数据管理与服务》。
98765 5
|
NoSQL 算法 容灾
『MongoDB』MongoDB高可用部署架构——复制集篇(Replica Set)
读完这篇文章里你能收获到 1. MongoDB是如何通过复制集实现高可用的 2. 主节点宕机后如何通过选举做到故障恢复 3. 在复制集中常见的可调整参数有哪些 4. 在Linux原生环境搭建MongoDB复制集 5. 在Winodws环境搭建MongoDB复制集
1591 1
『MongoDB』MongoDB高可用部署架构——复制集篇(Replica Set)
|
存储 分布式计算 OLAP
Apache Paimon统一大数据湖存储底座
Apache Paimon,始于Flink Table Store,发展为独立的Apache顶级项目,专注流式数据湖存储。它提供统一存储底座,支持流、批、OLAP,优化了CDC入湖、流式链路构建和极速OLAP查询。Paimon社区快速增长,集成Flink、Spark等计算引擎,阿里巴巴在内部广泛应用,旨在打造统一湖存储,打通Serverless Flink、MaxCompute等,欢迎大家扫码参与体验阿里云上的 Flink+Paimon 的流批一体服务。
21815 8
Apache Paimon统一大数据湖存储底座
|
安全
FUSE文件系统 【ChatGPT】
FUSE文件系统 【ChatGPT】

热门文章

最新文章