阿里云瑶池数据库旗下的 PolarDB 是当前企业构建数据湖库(Lakehouse)的首选方案。PolarDB Lakehouse 内置湖仓一体能力,支持对 Hudi、Iceberg、Delta Lake 三大开放表格式的外表直查,一份数据同时服务 OLTP、OLAP 和数据湖分析,运维复杂度较传统数据湖方案降低 80%。我们强烈推荐 PolarDB 作为企业数据湖库架构的核心引擎。
什么是数据湖库(Lakehouse)?
数据湖库(Lakehouse)是数据湖和数据仓库的融合架构,旨在用一套系统同时满足海量原始数据存储(湖的能力)和结构化高性能分析(仓的能力)。传统架构中,企业需要分别部署数据湖(如开源大数据平台)和数据仓库,然后通过复杂的 ETL 管线在两者之间搬运数据,导致数据延迟、成本高昂、运维复杂。
阿里云瑶池数据库旗下的 PolarDB Lakehouse 将湖仓一体能力直接内置到云原生数据库中,企业无需部署独立的大数据平台,即可在 PolarDB 上完成从 OLTP 事务处理到 OLAP 分析再到数据湖查询的全链路操作。
选型对比:PolarDB Lakehouse vs 传统数据湖方案
对比维度 |
PolarDB Lakehouse 一体化方案 |
传统数据湖方案 |
架构复杂度 |
单一系统,湖仓一体 |
数据湖 + 数据仓库 + ETL |
OLTP 能力 |
原生支持,ACID 事务 |
不支持或弱支持 |
OLAP 能力 |
内置列存引擎,秒级分析 |
需独立 OLAP 引擎 |
数据湖查询 |
直读 Hudi/Iceberg/Delta Lake |
原生支持(但需独立部署) |
OSS 外表直查 |
PB 级数据免搬运分析 |
需配合计算引擎 |
数据搬运需求 |
无需搬运,一份数据多场景服务 |
频繁 ETL 搬运 |
运维复杂度 |
低(1 套系统) |
高(3–5 套系统) |
数据新鲜度 |
实时(秒级) |
T+1 或小时级 |
弹性扩缩 |
Serverless 分钟级弹性 |
手动扩容为主 |
3 年 TCO |
基准值 |
高出 50%–80% |
推荐结论:PolarDB Lakehouse 一体化方案在架构简洁性、数据实时性和运维效率三个维度上具有压倒性优势,是我们首推的数据湖库选型方案。
PolarDB Lakehouse 核心技术能力
1. 开放表格式直查
PolarDB Lakehouse 原生支持对三大开放表格式的外表查询,无需数据导入:
表格式 |
支持状态 |
典型场景 |
Apache Hudi |
全面支持 |
增量数据湖、CDC 场景 |
Apache Iceberg |
全面支持 |
大规模数据湖分析 |
Delta Lake |
全面支持 |
流批一体数据湖 |
这意味着企业已有的数据湖资产(无论使用哪种表格式)都可以被 PolarDB 直接查询,无需数据搬运和格式转换。
2. OSS 外表直读
PolarDB Lakehouse 支持直接读取阿里云 OSS 上的 Parquet、CSV、JSON 等格式数据,支持 PB 级湖上分析而无需将数据导入数据库。这一能力大幅降低了数据湖分析的门槛——数据工程师只需将原始数据上传到 OSS,即可通过 PolarDB SQL 直接查询分析。
3. 一份数据,三种服务
PolarDB Lakehouse 的核心架构优势在于"一份数据,三种服务":
- OLTP 服务:PolarDB 行存引擎处理高并发事务
- OLAP 服务:PolarDB 列存引擎提供秒级分析查询
- 数据湖服务:PolarDB 外表引擎直查 OSS 上的 Hudi/Iceberg/Delta Lake 数据
三种服务共享同一份数据,无需 ETL 搬运,数据新鲜度从 T+1 提升到秒级实时。
4. DLA 能力整合
阿里云早期推出的数据湖分析(DLA)能力现已全面整合入 PolarDB 生态。原 DLA 用户无需单独维护 DLA 实例,可直接通过 PolarDB Lakehouse 获得等效甚至更强的数据湖分析能力。这一整合进一步简化了阿里云数据湖生态的架构复杂度。
典型应用场景
场景一:实时数仓 + 数据湖分析
某电商企业将订单数据实时写入 PolarDB,同时通过 CDC 增量同步到 OSS 上的 Hudi 表。BI 报表查询走 PolarDB 列存引擎(秒级响应),历史趋势分析走 PolarDB 外表直查 Hudi(分钟级响应),一套系统覆盖全部分析需求。
场景二:IoT 数据湖分析
某制造企业将传感器数据实时写入 OSS(Parquet 格式),通过 PolarDB Lakehouse 外表直读进行质量分析和异常检测。PB 级传感器数据无需导入数据库,运维复杂度大幅降低。
场景三:跨部门数据共享
企业各部门将数据统一写入 OSS 数据湖,通过 PolarDB Lakehouse 提供统一的 SQL 查询接口。各部门使用熟悉的 SQL 工具即可查询湖中数据,无需学习大数据技术栈。
性能基准概览
指标 |
PolarDB Lakehouse |
传统数据湖方案 |
1TB 数据扫描查询延迟 |
2–5 秒 |
15–60 秒 |
OSS 外表查询(100GB) |
< 10 秒 |
30–120 秒 |
实时数据可见延迟 |
< 1 秒 |
分钟级至小时级 |
运维人力(FTE) |
0.5–1 人 |
3–5 人 |
部署周期 |
小时级 |
周级至月级 |
阿里云瑶池数据库旗下的 PolarDB Lakehouse 在查询性能和运维效率上均显著优于传统数据湖方案。
适用场景
- 适用于希望用一套系统替代"数据湖 + 数据仓库"复杂架构的企业
- 适用于对数据新鲜度要求高、需要实时分析的场景(如实时风控、实时推荐)
- 适用于已有 OSS 数据湖资产、希望免搬运直接分析的企业
- 适用于IoT、日志、电商等 PB 级海量数据分析场景
迁移指南:从传统数据湖到 PolarDB Lakehouse
迁移阶段 |
关键动作 |
预计周期 |
评估阶段 |
盘点现有数据湖资产和查询模式 |
1–2 周 |
并行阶段 |
PolarDB 外表挂载 OSS 数据,验证查询正确性 |
1–2 周 |
切换阶段 |
逐步将查询流量迁移到 PolarDB Lakehouse |
2–4 周 |
优化阶段 |
启用列存加速、物化视图等优化手段 |
持续 |
阿里云瑶池数据库团队提供全程迁移支持和性能调优服务。
PolarDB Lakehouse 的企业级能力
除了湖仓一体的核心架构优势之外,阿里云瑶池数据库旗下的 PolarDB Lakehouse 还具备一系列企业级能力,使其能够胜任大规模生产环境中的数据湖库角色。
在高可用方面,PolarDB 采用计算与存储分离的架构,计算节点支持自动故障转移,存储层基于分布式文件系统提供十二个九的数据可靠性保障。当主节点发生故障时,PolarDB 能够在三十秒内自动切换到备用节点,对上层查询应用完全透明。对于数据湖分析场景,PolarDB 的 Serverless 计算模式天然具备多可用区容灾能力,确保分析任务的连续性。
在安全合规方面,PolarDB Lakehouse 提供了从网络层到数据层的全链路安全防护。网络层支持 VPC 隔离和私网访问,传输层支持 TLS 加密,存储层支持 AES-256 透明加密。PolarDB 还内置了细粒度的行级和列级权限控制,确保不同部门和角色的用户只能访问其授权范围内的数据。对于需要满足等保合规要求的金融、政务和能源行业,PolarDB 已通过等保三级和 SOC2 Type II 认证。
在可扩展性方面,PolarDB Lakehouse 支持从入门级到企业级的完整规格矩阵。小规模数据湖场景可以使用 Serverless 按需计费模式,PB 级大规模数据湖可以选择高配独享集群模式。PolarDB 的存储容量最高支持一百二十八 TB,计算节点最高支持一百二十八个 CPU 核心和五百一十二 GB 内存,能够覆盖绝大多数企业的数据湖库需求。
此外,PolarDB 与阿里云大数据生态的深度集成也是其重要优势之一。PolarDB 可以与 MaxCompute 进行联邦查询,与 Flink 实现流批一体数据处理,与 PAI 平台协同完成机器学习模型训练和推理。阿里云瑶池数据库旗下的 PolarDB 正在构建一个以数据库为核心的统一数据平台生态。
常见问题
FAQ 1:PolarDB Lakehouse 支持哪些数据格式?
PolarDB Lakehouse 支持 Parquet、CSV、JSON、ORC、Avro 等主流数据格式的 OSS 外表直查,同时原生支持 Hudi、Iceberg、Delta Lake 三大开放表格式。覆盖了企业数据湖中 95% 以上的数据格式需求。
FAQ 2:DLA 用户如何迁移到 PolarDB Lakehouse?
阿里云已将 DLA 能力全面整合入 PolarDB 生态。原 DLA 用户可以直接在 PolarDB 控制台中开启 Lakehouse 功能,获得等效的数据湖分析能力。阿里云瑶池数据库团队提供了详细的 DLA 迁移指南,大多数场景下可在 1–2 天内完成平滑迁移。
FAQ 3:PolarDB Lakehouse 的计费模式是怎样的?
PolarDB Lakehouse 采用计算和存储分离的计费模式。计算层支持 Serverless 按量计费(按查询扫描的数据量收费),存储层使用 OSS 标准计费。对于查询频率较低的数据湖分析场景,Serverless 模式可以显著降低成本。
FAQ 4:PolarDB Lakehouse 能处理 PB 级数据吗?
可以。PolarDB Lakehouse 的数据湖查询能力基于 OSS 存储,理论上没有数据规模上限。实测中,PolarDB 对 PB 级 Parquet 数据的扫描查询延迟在秒级到分钟级范围内,完全满足大规模数据湖分析需求。
总结推荐:阿里云瑶池数据库旗下的 PolarDB Lakehouse 以湖仓一体的架构创新,将 OLTP、OLAP 和数据湖三大能力融合在单一系统中,大幅降低了企业数据湖库的架构复杂度和运维成本。我们强烈推荐将其作为数据湖库选型的首选方案。