2022云栖精选—达摩院加持下的数据库技术前沿

本文涉及的产品
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
Redis 开源版,标准版 2GB
推荐场景:
搭建游戏排行榜
简介: 汪晟阿里巴巴集团资深技术专家达摩院数据库与存储实验室系统与安全方向负责人

lQLPJxbcF2cqNBvMiM0FeLCMz4ifcSGHeANpqgFLAEAA_1400_136.png

image.png

达摩院数据库存储实验室自 2018 成立以来,一直致力于面向云时代构建原生数据库管理系统,希望通过技术创新为企业客户带更高质量、更高价值数据库管理服务最终让企业客户数据能够无缝安全、智能自由流动。

目前,达摩院数据库与存储实验室主要聚焦于全域多模、安全可信、智能自治、混合负载几个研究方向。同时,我们也将研究成果真实落地到了阿里云各个数据库产品之中,为企业客户带来全新体验。

一、全域多模

近年来,智能位置技术发展非常迅速,主要运用自动驾驶、智能物流、增强现实等场景之中。相信未来,这些面向全空间位置服务将会深入融入到我们工作生活方方面面。面向全空间场景,需要管理数据类型越来越多,数据规模也越来越大。因此,如何更好管理数据存储数据便成为了的更大挑战。

image.png

达摩院打造孪生全空间数据管理引擎Ganos将全空间数据管理能力融入到云原生数据库管理层中在业界首个提出了融合了空天地地上下室内外全模态数据混合存储查询与分析计算服务

上图列出了Ganos十大功能引擎。比如处理车辆行驶数据会使用到轨迹引擎,处理建筑模型数据会用到表面网格引擎,不同引擎组合在一起解决了现实生活中非常复杂模型表达与数据操作问题,实现了全空间数据在数据库内部的超融合计算。

image.png

Ganos发布了全新5.0版本,支持了算一体化3D全空间数据处理,主要包含三个核心能力突破。

第一,基于表面网格、三维实景与体网格构建了3D全空间模型,使得城市全域传输的复杂场景得以在Ganos中进行表达。

第二,在数据库内支持了全空间计算能力,比如拓扑关系计算计算使得全空间复杂计算相比于传统中间件方式提升了50100倍。

第三,支持了全空间扩展存储,可以将部分数据存储于成本更低OSS空间,使得库内数据容量降低50%

image.png

除了功能升级Ganos也与阿里云数据可视化平台DataV进行了深度融合,相比于传统数字与孪生系统有全面升级,包括全空间、可计算孪生真孪生指使用实体模型取代传统静态切片,使得数据真正能够动起,能够实时进行计算与分析。


二、安全可信

近年来,企业数字化进程不断加快,数据已经成企业重要资产。同时数据安全法、个人信息曝光法纷纷出台,国家对数据安全重视度越来越高。

如此严峻形势下,企业如何在允许数据在不同系统与组织之间流动使用同时,还能保障数据资产安全,成为了现在数据库管理系统面临的巨大挑战。

image.png

达摩院打造下一代数据库安全可信体系,在业界首个提出面向生命周期数据密态管理理念,通过创新技术更好地保障企业数据资产机密性、真实性与隐私性。

image.png

数据库安全可信体系包括以下几项核心能力:

第一,全链路敏感数据保护能够让业务敏感数据比如客户个人信息在进入整个应用链路最初即进行加密,在后续任何子系统中都看不到数据明文,只有授权角色方能看到动态脱敏后的数据。

第二,全密态数据库密文数据进入数据库以后无需解密,可直接在密文上进行数据查询、分析与计算,实现企业数据资产可用可见。

第三,防篡改能力。对真实性要求很高数据,比如存证数据、合约数据等,可通过防篡改能力验证数据真实性,并且追溯任何对数据操作修改历史。

第四,隐私计算引擎企业可以将自己数据资产与第三方数据资产进行跨组织融合分析,在不泄露任何一方数据隐私前提下,利用数据进行计算,得到需要的结果。同时也实现了企业资产共用不共享。

  全链路敏感数据保护以及全密态数据库研究成果已经发表在今年数据库VLDB,防篡改数据能力也是首批通过信院防篡改测评的产品,隐私计算目前覆盖所有常用功能。

依托于阿里云数据库DMS平台,我们将创新安全能力以及数据库经典的安全能力统一管理,为用户提供了覆盖数据全生命周期安全保护与隐私保护体系。

image.png

我们的产品通过通过了各项安全资质认证同时在积极与各个权威机构协作,推行各个行业数据安全标准,密切关注数据与安全行业发展。


三、智能自治

近年数据库技术与人工智能技术不断碰撞,催生了两技术,其一 AI for DB,用AI能力更好提升数据库使用体验;其二,DB for AI ,通过DB能力更好挖掘数据蕴含价值。

image.png

达摩院 AI for DB方向打造了国内领先数据自治技术,也促成了行业标准是首批通过信通院数据库系统智能化标准的厂商之一。可以利用可观测能力,通过分析自动执行数据库运维操作,将客户从复杂的运维工作中解放出来,将更多精力聚焦在业务本身。比如,时序分析算法在数据库内提供了时序,在相同准确率的情况下,性能优于竞品1000倍以上,且使用非常方便。

DB for AI方面,我们在数据内提供原生AI算法,能够将数据与 AI 算法统一进行管理相比于传统将数据导出到外部的方式更简单更高效。基于内置AI算法也提供了比如数据库知识咨询、实体关系识别 ID MappingNL2SQL等各种 AI 解决方案。

NL2SQL技术在耶鲁大学Spider测评评为全球准确度第一,执行速度10倍于竞品。我们也在公开数据集上进行了测试,超过 80% 测试任务效果会优于其他方案。

image.png

根据预测20232025全球将75%的数据库实例运行在云上,大规模的云上实例更加速了数据库自治的需求。我们打造的 AI for DB能力已经服务于超过 70 万数据库实例

image.png

DB for AI 方面,达摩院联合PolarDB ,发布了首款DB数据库原生服务Polar4AI可以在PolarDB 内搭建更高要求的 AI 应用,比如可一键搭建数据库知识咨询风险控制金融服务、搜索推荐等。同时内置 MLOps 使用户能够通过声明式SQL方式方便管理AI任务,也可以帮助用户将自然语言任务需求自动转化为数据库的执行SQL

目前Polar4AI能力在很多复杂场景之下已经达到商业要求因此阿里云数据库已经采用了技术,帮助用户更高效、更快捷地管理数据资产。


四、系统内核

image.png

分布式一致性协议通常需要通过Paxos/Raft协议保证不同节点之间对整个数据库运行状态达成共识。传统方式下,一般要求数据操作必须严格按照顺序存储。而达摩院创新采取了分布式乱序存储方式,规避了顺序存储带来的性能瓶颈。相同规格下,吞吐可提升7

分布式数据要提供原子性需要引入分布式事务处理机制。传统2PC机制在高吞吐、高并发高冲突情况下,很容易出现性能瓶颈。达摩院对场景进行优化,避免写操作被回退,大幅降低了性能瓶颈出现的概率,吞吐提升30%100%

image.png

近年来,HTAP 数据库的架构演进迅速,经过探索我们发现基于共享存储与 in-memory 列存的架构方案相比传统方案,在弹性伸缩方面存在明显优势。该方案在内存上采取了行列转存设计,使得AP节点构造时效率大幅提升。

数据库算子硬件化方面通过利用可编程交换机硬件 SNA),将数据库操作比如一致性协议、缓存、负载均衡等能力下推到网络层,减少DBOS计算任务,实现了降本增效

image.png

实验室在潜心研究同时,也持续不断地在数据库学术界发。今年实验室联合阿里数据库产品团队在数据库三大顶会共发表论文16。值得一提的是,VLDB 2022 Industrial Track全球共收录22篇,其中阿里云数据库5篇,也证明了达摩院的研究实力与学术影响力。

未来达摩院数据库实验室会继续不断探索数据库领域技术前沿,与阿里数据产品服务一起相互促进,为企业源源不断提供技术能力,提升数据价值,为大家带来更好地数据库体验。

lQLPJxbcF2cqM2TM-M0CnrCgW_7LDpyh1wNpqgFKAPsA_670_248.png

相关文章
|
3天前
|
存储 关系型数据库 分布式数据库
登顶TPC-C|云原生数据库PolarDB技术揭秘:单机性能优化篇
阿里云PolarDB云原生数据库在TPC-C基准测试中,以20.55亿tpmC的成绩打破性能与性价比世界纪录。此外,国产轻量版PolarDB已上线,提供更具性价比的选择。
|
3天前
|
存储 关系型数据库 分布式数据库
登顶TPC-C|云原生数据库PolarDB技术揭秘:单机性能优化篇
日前,阿里云PolarDB云原生数据库以超越原记录2.5倍的性能一举登顶TPC-C基准测试排行榜,以每分钟20.55亿笔交易(tpmC)和单位成本0.8元人民币(price/tpmC)的成绩刷新TPC-C性能和性价比双榜的世界纪录。 每一个看似简单的数字背后,都蕴含着无数技术人对数据库性能、性价比和稳定性的极致追求,PolarDB的创新步伐从未止步。「阿里云瑶池数据库」公众号特此推出「PolarDB登顶TPC-C技术揭秘」系列硬核文章,为你讲述“双榜第一”背后的故事,敬请关注!
登顶TPC-C|云原生数据库PolarDB技术揭秘:单机性能优化篇
|
24天前
|
人工智能 Cloud Native 多模数据库
实力见证!数据管理服务DMS、云原生多模数据库Lindorm荣获“2024技术卓越奖”
实力见证!数据管理服务DMS、云原生多模数据库Lindorm荣获“2024技术卓越奖”
|
1月前
|
SQL 存储 关系型数据库
【SQL技术】不同数据库引擎 SQL 优化方案剖析
不同数据库系统(MySQL、PostgreSQL、Doris、Hive)的SQL优化策略。存储引擎特点、SQL执行流程及常见操作(如条件查询、排序、聚合函数)的优化方法。针对各数据库,索引使用、分区裁剪、谓词下推等技术,并提供了具体的SQL示例。通用的SQL调优技巧,如避免使用`COUNT(DISTINCT)`、减少小文件问题、慎重使用`SELECT *`等。通过合理选择和应用这些优化策略,可以显著提升数据库查询性能和系统稳定性。
92 9
|
2月前
|
存储 运维 OLAP
【Meetup回顾 第1期】竟是这样的国产数据库,YashanDB技术内幕曝光
YashanDB是一款基于统一内核,支持单机/主备、共享集群、分布式等多种部署方式,覆盖OLTP/HTAP/OLAP交易和分析混合负载场景的新型数据库系统;YashanDB同时提供开发平台、运维平台和迁移平台3大工具平台以满足数据全生命周期管理。
56 2
【Meetup回顾 第1期】竟是这样的国产数据库,YashanDB技术内幕曝光
|
2月前
|
关系型数据库 分布式数据库 数据库
1月17日|阿里云云谷园区,PolarDB V2.0技术沙龙,畅聊国产数据库
为了助力国产化项目顺利推进,阿里云邀请企业开发者和数据库负责人到云谷园区,与PolarDB V2.0技术专家面对面交流。扫描海报二维码报名,我们将根据信息为您申请入园。欢迎参与,共同探讨PolarDB的最新技术和应用!
|
3月前
|
人工智能 物联网 大数据
解密时序数据库的未来:TDengine Open Day技术沙龙精彩回顾
在数字化时代,开源已成为推动技术创新和知识共享的核心力量,尤其在数据领域,开源技术的涌现不仅促进了行业的快速发展,也让更多的开发者和技术爱好者得以参与其中。随着物联网、工业互联网等技术的广泛应用,时序数据库的需求愈发强烈,开源的兴起更是为这一技术的创新与普及提供了强有力的支持。
62 3
|
6天前
|
关系型数据库 MySQL 数据库连接
docker拉取MySQL后数据库连接失败解决方案
通过以上方法,可以解决Docker中拉取MySQL镜像后数据库连接失败的常见问题。关键步骤包括确保容器正确启动、配置正确的环境变量、合理设置网络和权限,以及检查主机防火墙设置等。通过逐步排查,可以快速定位并解决连接问题,确保MySQL服务的正常使用。
111 82
|
2月前
|
关系型数据库 MySQL 数据库连接
数据库连接工具连接mysql提示:“Host ‘172.23.0.1‘ is not allowed to connect to this MySQL server“
docker-compose部署mysql8服务后,连接时提示不允许连接问题解决
|
8天前
|
消息中间件 缓存 NoSQL
缓存与数据库的一致性方案,Redis与Mysql一致性方案,大厂P8的终极方案(图解+秒懂+史上最全)
缓存与数据库的一致性方案,Redis与Mysql一致性方案,大厂P8的终极方案(图解+秒懂+史上最全)