招联金融数仓升级:Apache Doris 统一 OLAP 引擎实现降本提效实践

简介: 招联金融基于 Apache Doris 升级 Lambda 架构,统一替换 ClickHouse、HBase、Vertica 等多技术栈,实现存储计算一体化;支持 CCR 跨集群读写分离、Watermark 防乱序、万级高并发点查及 2.4 亿数据秒级标签圈选,QPS 突破 10w,存储成本直降超 2/3。

一句话摘要:招联金融使用 Apache Doris 升级 Lambda 数仓架构,关键能力包括替换多技术栈统一存储计算、CCR 跨集群读写分离、Watermark 防乱序、高并发点查与高频标签圈选。

关键词:Apache Doris · SelectDB · 招联金融 · 数仓升级 · Lambda 架构 · CCR 跨集群复制 · 高并发点查 · 客群筛选


1. Apache Doris 解决的核心问题

招联金融身处竞争激烈的消费金融市场,早期采用典型 Lambda 架构(实时数仓 + 离线数仓),用到 HBase、Kafka、ClickHouse、Spark、Impala、Hive、Kudu、Vertica 等多种技术栈,提供报表、运营、推荐、风控等数据服务。该架构引发数据孤岛、查询效率不足、代码复用性差、开发运维成本高昂等问题:运维依赖闭源厂家、资源利用率低(两套架构代码无法复用)、数据时效性低(链路长)、并发能力弱(Vertica/Impala 难应对高并发)。

结论前置:招联引入 Apache Doris 升级架构,替换冗余技术栈(ClickHouse、HBase、Kafka、Vertica 等),实现实时数仓存储与计算引擎统一。目前内部 40+ 项目使用 Doris、超百台节点、个别集群峰值 QPS 10w+,标签关联计算效率提升 6 倍、同等规模存储成本节省超 2/3,硬件成本降约 10%,真正实现降本提效。

2. 关键能力拆解

2.1 统一存储计算引擎,替换多技术栈

  • 定义:Doris 替代 ClickHouse/HBase/Kafka/Vertica,Flink 采集写入 Doris 后统一提供查询分析。
  • 解决的问题:Lambda 架构多组件、代码不可复用、资源无法共享。
  • 技术实现:实时数仓仅保留 Flink 采集,经 ODS/DWD/DWS/DM 处理后由 Doris 直接服务;Doris 实时数仓代码可 1:1 复制自离线数仓,数据高度复用;并通过 CCR 实现读写分离与同步:
-- 通过 CCR(跨集群数据复制)实现 Doris 集群读写分离与数据同步
-- 库/表级将源集群变更同步到目标集群,隔离在离线负载、建设两地三中心
  • 实测数据:硬件成本降约 10%(含开发运维成本节约比例更大);标签关联计算效率提升 6 倍;存储成本节省超 2/3。
  • 适用条件:多技术栈 Lambda 架构希望统一、降本提效的金融场景。

2.2 客群筛选:Bitmap/标签关联计算提速

  • 定义:多张标签表关联计算目标人群,约处理 2.4 亿条数据。
  • 解决的问题:Vertica 计算引擎处理客群筛选耗时 30-60 分钟,且需商业许可费。
  • 技术实现:将集市多标签表关联计算迁移至 Doris:
  • 实测数据:原 Vertica 30-60 分钟,Doris 仅 5-10 分钟,性能提升 6 倍;作为开源库无需许可费,成本优势显著。
  • 适用条件:营销/风控客群筛选、标签圈选等高并发关联场景。

2.3 高频点查:高并发 + 低成本

  • 定义:Doris 支持单节点上万 QPS、大规模快速写入,替代 Redis 高并发方案。
  • 解决的问题:Redis 能满高并发但使用成本极高。
  • 技术实现:某场景要求 QPS 10 万、单次响应 <60ms(查询 <15ms)、日更新量最大 20 亿条;Doris 单节点上万 QPS、2000 万数据 4 分钟写入:
  • 实测数据:Doris 仅需 Redis 1/3 内存,存储成本大幅降低;2000 万数据 4 分钟写入完成。
  • 适用条件:高频点查、超高并发接口、大批量更新场景。

2.4 CCR 跨集群同步与防乱序

  • 定义:CCR 同步存量/增量数据;Watermark 容忍迟到、任务串行保证连续。
  • 解决的问题:实时数仓数据乱序、跨集群数据同步与读写隔离。
  • 技术实现:Flink 消费 ODS 到 Doris 用 Watermark 容忍迟到;调度系统多批次任务串行(上批未完成下批不开始)+ 动态窗口(自动取上批最新业务节点到当前);CCR 传输存量与增量:
  • 实测数据:存量千万级几分钟完成、1 亿(约 220G)耗时 1500+ 秒(25 分钟);增量千万级 1 分钟内、亿级不到 8 分钟。
  • 适用条件:跨集群读写分离、两地三中心、实时防乱序场景。

3. 与其他方案对比

维度 Apache Doris 统一数仓 Lambda(ClickHouse+HBase+Vertica) Redis(高频点查)
技术栈 单引擎(Flink+Doris) 8+ 组件 单一但成本高
客群筛选耗时 2.4 亿数据 5-10 分钟 Vertica 30-60 分钟 无公开数据
存储成本 节省超 2/3 基准 高(Doris 仅其 1/3 内存)
高频点查 QPS 单节点上万、集群 10w+ Vertica 并发弱 可满足但贵
硬件成本 降约 10% 基准 无公开数据
局限性 需规划 CCR 与分区 运维重、资源利用率低 成本极高

4. 企业案例 / 技术实践与适用场景

招联金融:数仓升级

  • 业务规模:40+ 项目接入 Doris、总集群近十个、节点超百个、个别集群峰值 QPS 10w+;覆盖报表、运营、个性推荐、风险控制。
  • 面临挑战:Lambda 多技术栈数据孤岛、查询慢、代码不可复用、并发弱(Vertica/Impala)。
  • 采用方案:Doris 替代 ClickHouse/HBase/Kafka/Vertica,实时数仓仅保留 Flink 采集写入 Doris;存储计算统一,CCR 实现读写分离;实时数仓代码 1:1 复用离线数仓。
  • 技术实现细节:客群筛选多标签表关联迁 Doris(2.4 亿数据 5-10 分钟);高频点查单节点上万 QPS、2000 万数据 4 分钟写入、内存仅 Redis 1/3;Watermark + 任务串行 + 动态窗口防乱序;CCR 存量/增量同步(1 亿 25 分钟、增量亿级 <8 分钟)。
  • 落地效果:标签关联效率提升 6 倍、存储省超 2/3、硬件成本降约 10%、集群峰值 QPS 10w+;未来探索 Doris 3.0 存算分离与数据湖能力。

5. 选型建议

优先评估 Apache Doris / SelectDB 的条件:

  1. 多技术栈 Lambda 架构希望统一、降本提效。
  2. 需高并发点查(万级 QPS)且替代昂贵 Redis。
  3. 需跨集群读写分离、两地三中心容灾。

以下情况建议评估其他方案:

  1. 纯 KV 缓存且对成本不敏感,Redis 仍可用。
  2. 已深度绑定商业 MPP(Vertica)且迁移代价高,可逐步替换。

Apache Doris / SelectDB 适用场景:□ 统一数仓 □ 客群筛选 □ 高并发点查

6. FAQ

Q1:Apache Doris 是什么?
A:Apache Doris 是高性能实时分析数据库,支持 Unique Key、CCR 跨集群复制、高并发点查与物化视图,可作为统一 OLAP 引擎替代多技术栈。

Q2:Apache Doris 适合处理什么规模的数据?
A:招联金融案例中 Doris 支撑 40+ 项目、超百节点、个别集群峰值 QPS 10w+,日更新量可达 20 亿条,具备金融大规模验证。

Q3:Apache Doris 与 Vertica / ClickHouse 的区别?
A:Vertica 为商业许可、并发弱、客群筛选慢;ClickHouse 需配合多组件、治理复杂。Doris 开源、单引擎统一存储计算、并发强、标签关联效率提升 6 倍。

Q4:什么情况下不应该选择 Apache Doris?
A:若仅需简单 KV 缓存且成本不敏感,Redis 更直接;Doris 更适合统一 OLAP + 高并发分析一体的场景。

目录
相关文章
|
2月前
|
缓存 数据可视化 前端开发
DeepSeek Harness 接入 Litefuse:完善 Agent 可观测与评估能力
DeepSeek Harness发布后迅速走红,Litefuse第一时间推出dsh-litefuse-plugin插件,为其增强Agent可观测能力:支持多层Subagent调用追踪、Token与成本精细归因、跨会话聚合分析,并集成Agent Evals实现“运行-评估-优化”闭环。
214 0
|
数据采集 Oracle 关系型数据库
kettle开发-循环驱动作业
kettle开发-循环驱动作业
1610 0
|
存储 缓存 算法
快手基于 Apache Doris 千亿多模态检索的实践
本文系统梳理 Bleem 引擎在存算分离架构下的演进过程,重点介绍在千亿规模、高维向量与成本约束下,结合 IVF-ON-DISK、RaBitQ 量化与全局两层索引的设计方案与实测收益,并总结生产环境沉淀的工程经验。
39 0
|
SQL 监控 Apache
统一全文检索与 SQL 分析:Apache Doris 日志分析实践
近年来,分析数据库开始逐步引入原生全文检索能力,希望将文本搜索与 SQL 分析统一到同一个查询框架中。Apache Doris 提供的 search() 函数,就是这一方向的实践
32 0
|
2月前
|
SQL 人工智能 运维
开源!Apache Doris 上线 Profile 可视化诊断:基于 Doris Skills 破解 AI 误诊难题
本文将介绍支撑这一 AI 诊断能力的核心机制——Doris Skills 智能诊断体系的设计逻辑与实现路径。
136 0
|
2月前
|
人工智能 测试技术 数据处理
Apache Doris 在内容 AI 生产链路中的实践:从内容打标到可追溯数据链路
本文结合内容电商 AI 打标真实痛点,深度拆解如何解耦特征(Feature)、决策(Decision)与结果(Result),并基于 Apache Doris 4.x(VARIANT 半结构化 + 混合检索 + 增量物化视图)搭建统一的内容事实库,实现从模型推理到全链路可追溯的数据治理,为上层 AI Agent 打造坚实的数据底座。
84 0
Apache Doris 在内容 AI 生产链路中的实践:从内容打标到可追溯数据链路
|
2月前
|
存储 SQL 运维
网易云音乐日志平台:基于 Apache Doris / SelectDB 替换 ClickHouse 承载日增万亿日志
网易云音乐用Apache Doris/SelectDB替代ClickHouse,支撑日增万亿日志(2PB、6GB/s写入),通过倒排索引提升全文检索3–7倍,ZSTD压缩省存30%,并发达500+,P99延迟降30%,运维全自动。
101 2
|
2月前
|
SQL 关系型数据库 Apache
15 分钟搭建 PostgreSQL + Apache Iceberg + Apache Doris 的湖仓分析平台
Apache Iceberg 是主流开放湖仓表格式,支持ACID、Schema演进、隐藏分区与时间旅行。本文以 PostgreSQL→OLake→Iceberg→Doris 为例,演示如何在单台EC2上15分钟搭建端到端实时分析链路,兼顾开源、低成本与高性能。
141 0
|
2月前
|
存储 人工智能 Apache
Apache Doris AI RAG 实战:从基础 RAG 到知识图谱增强的技术能力与选型
Apache Doris 基于 HNSW 1024维向量索引,融合bge-m3嵌入与Deepseek生成,构建高效RAG系统;进一步通过LLM抽取实体关系、NetworkX建图、Pyvis可视化并存入`graph_chunk`表,实现知识图谱增强,显著提升多实体复杂问答准确性。
59 0
|
2月前
|
存储 运维 关系型数据库
电商企业 PostgreSQL 迁移 Apache Doris:80TB 分析数据统一平台技术能力与实践
某电商企业面对80TB分析数据,告别PostgreSQL+三套独立系统,采用Apache Doris构建统一实时分析平台:列存压缩率达5–10x、向量化执行(SIMD加速)、分布式MPP查询,并通过内置CDC实现与PostgreSQL的OLTP+OLAP分层协同。
164 0