智能分析的所见即所得——基于Lambda架构的实时数据引擎

简介: 在刚刚结束的“2019智能决策峰会”上,观远数据重磅发布了观远智能分析平台2.0版本。高性能实时数据引擎作为备受瞩目的功能,得到了大家的广泛认可。下面就让我们一起来了解下基于Lambda架构的观远实时数据解决方案。

在刚刚结束的“2019智能决策峰会”上,观远数据重磅发布了观远智能分析平台2.0版本。高性能实时数据引擎作为备受瞩目的功能,得到了大家的广泛认可。下面就让我们一起来了解下基于Lambda架构的观远实时数据解决方案

BI与实时数据

随着商业领域中的业务场景越来越复杂,更实时、更大量的数据正在被不断生产出来,如何将这些实时的海量数据高效的进行处理就变成了一个挑战。一般而言,传统BI只能支持T+1天时效延迟的数据决策,数据处理过程以ETL为主,实时数据处理存在天然缺陷;但新一代BI增加了更多样化数据源的导入存储,支持了更灵活的数据处理方式与更敏捷的数据处理时效,在合理规划服务器计算资源的前提下,新一代BI可以支持准实时、甚至分钟级实时数据的更新展示。可见,数据实时化已成为新一代BI的显著优势。

Lambda架构

作为新一代BI的典型代表,观远数据基于Lambda架构设计了一套高性能的实时数据引擎,那么什么是Lambda架构呢?

Lambda架构是一套通用的的实时大数据处理框架,其作者Nathan Marz基于对数据和查询的本质认识,整合了离线计算与实时计算,融合了不可变性、读写分离和复杂性隔离等一系列架构原则,从而设计出能满足实时大数据系统关键特性(如高容错、低延时、可扩展等)的Lambda架构。

Lambda架构的核心思想是将大数据处理系统划分为三层:Batch Layer、 Real-Time(Speed) Layer以及Serving Layer,从而将实时任务与批处理任务很好地结合起来,最终实现对大数据的实时处理。

  • Batch Layer:批处理层。该层可以很好的处理离线数据,在数据集上预先聚合好实时查询所需要数据的历史部分,从而得到Batch View。
  • Real-Time(Speed) Layer:加速层。该层可以处理最新的增量数据流,不断将数据以时间维度增量聚合到Real-Time View。
  • Serving Layer :服务层。用于响应用户的查询请求,可以合并Batch View和Real-time View中的数据到最终的展示结果。

_jpeg

Guandata实时引擎

在观远智能分析平台1.0时代,观远数据可以提供两种准实时数据解决方案,但他们都存在一些不足。

用户在创建直连数据库的数据集时,可选择“支持实时卡片数据”。数据集版本有效时间将会缩小为10分钟,用户基于该数据集进行数据查询展示时,可达到准实时的效果。但这种处理方式对业务库会造成较大压力,且无法实现多源数据融合。

_

Guan-Index类型的数据集可支持最高每天四次的更新频率,按此频率抽取到观远平台上来的数据,通过ETL可以实现与其他数据源的融合。相比于上一种方案,这种方案虽然突破了对于数据来源的限制,但一方面数据更新频率受到限制,另一方面ETL运行也会占掉大量的计算资源从而导致系统性能受到影响。

_

在观远智能分析平台2.0版本中,观远数据推出了最新一代的实时数据引擎,通过汲取Lambda架构的精髓,将历史数据与实时数据进行分开处理,既能够实现多源数据的融合,又可以支持增量更新且占用较少的计算资源。该方案最终不仅可以进行简单的数据实时更新与展示,还可以支持复杂的计算与分析(比如零售场景中常用的同环比指标以及累计指标的实时运算)。

_

下面以门店维度的销售指标监控为例,列举了实时数据分析的典型场景:

  • 门店经理通常需要关注当日每时每刻的业务KPI,但他关注的实时指标很有可能分散在不同的数据来源中(比如销售额、客流量);
  • 除了实时销售额以外,门店经理还会关注销售额的实时累计值,用来衡量本周累计完成的营业额是否已经达标,甚至会关心当前门店在整个区域乃至整个公司目前的销售额排名是什么水平,更复杂一点,如果能随时了解当前销售额到与昨天/上周同一时段相比的同环比变化,那就最好了;
  • 当然,门店经理关注的数据并非都是需要实时更新的,还会有一些相对静态的附加信息,例如门店基础信息、门店当天的目标营业额等。

实时数据的展示与融合

在观远实时数据解决方案中,通过多数据源的融合,对于门店经理关注的销售额以及客流量,都可以实现高频次的聚合与实时展示。

_

实时数据的复杂计算

零售行业中比较关注的累计值、排名、同环比,这些基于实时指标的二次分析与计算,在观远实时数据解决方案中也都可以得到完满的解决。


_
_2
_VS_

附加信息的展示

观远实时引擎同样可以通过数据融合的方式将附加信息添加为实时数据集的静态数据来源,从而进一步在可视化时进行展示。

_

Guandata实时数据引擎突破了观远1.0时代数据更新频率以及运算能力的限制,显著降低了数据从产生到消费的端到端时延,最终完美支持了实时的数据更新响应与极高频次的数据运算。

作为区别于传统BI的一大亮点,观远实时数据解决方案的应用场景还有很多,我们致力于把实时数据对于数据分析的价值发挥到极致。您在使用过程中遇到什么问题、有什么好的想法和建议,也欢迎留言来跟我们沟通探讨!

作者:观远产品部
产品咨询:shopbi2018
免费试用请戳

相关文章
|
3月前
|
缓存 网络协议 数据库连接
C/S架构中HTTP错误状态码原因分析及解决办法
HTTP(Hypertext Transfer Protocol)是用于在客户端和服务器之间传输数据的协议。当在浏览器或其他HTTP客户端中访问网页时,可能会发生各种访问报错。我们需要根据网页提供的错误状态码分析错误原因,以找到相对应的解决办法。
41 0
|
1月前
|
存储 前端开发 BI
基于云计算技术的B/S架构智能云HIS系统源码 集挂号、处方、收费、取药、病历于一体
云HIS是针对中小医院机构、乡镇卫生室推出的一套基于云端的云HIS服务平台,借助云HIS,将医院业务流程化,大大提高医院的服务效率和服务质量,为客户提供医院一体化的信息解决方案。云HIS主要功能:包含门诊收费管理,住院收费管理,门诊医生工作站,住院医生工作站,住院护士工作站,辅助检查科室管理,药房药品管理,药库药品管理,报表查询。满足诊所、中小医院业务中看诊、收费、发药、药库管理、经营分析等多环节的工作需要。
41 4
|
4月前
|
设计模式 前端开发 Java
KnowStreaming系列教程第二篇——项目整体架构分析
KnowStreaming系列教程第二篇——项目整体架构分析
40 0
|
4月前
|
人工智能 缓存 并行计算
技术改变AI发展:Ada Lovelace架构解读及RTX 4090性能测试分析(系列三)
简介:随着人工智能(AI)的迅速发展,越来越多的应用需要巨大的GPU计算资源。Ada lovelace(后面简称Ada)是NVIDIA最新的图形处理器架构,随2022年9月20日发布的RTX 4090一起公布。
135342 10
技术改变AI发展:Ada Lovelace架构解读及RTX 4090性能测试分析(系列三)
|
4月前
|
SQL 开发框架 安全
Linux系统中ARMv8架构u-boot启动流程分析
Linux系统中ARMv8架构u-boot启动流程分析
121 0
|
4月前
|
边缘计算 编译器 数据中心
X86架构与Arm架构的主要区别分析
X86架构与Arm架构的主要区别分析
461 0
|
19天前
|
设计模式 安全 Java
【分布式技术专题】「Tomcat技术专题」 探索Tomcat技术架构设计模式的奥秘(Server和Service组件原理分析)
【分布式技术专题】「Tomcat技术专题」 探索Tomcat技术架构设计模式的奥秘(Server和Service组件原理分析)
23 0
|
19天前
|
存储 Java 应用服务中间件
【分布式技术专题】「架构实践于案例分析」盘点互联网应用服务中常用分布式事务(刚性事务和柔性事务)的原理和方案
【分布式技术专题】「架构实践于案例分析」盘点互联网应用服务中常用分布式事务(刚性事务和柔性事务)的原理和方案
42 0
|
1月前
|
监控 JavaScript 安全
监控内网电脑软件设计与实现:基于Node.js的服务器端架构分析
在当今信息技术高度发达的时代,监控内网电脑的需求日益增长。企业需要确保网络安全,个人用户也需要监控家庭网络以保护隐私和安全。本文将介绍一种基于Node.js的服务器端架构,用于设计和实现监控内网电脑软件。
89 0
|
1月前
|
Web App开发 JavaScript 前端开发
分析网站架构:浏览器插件
分析网站架构:浏览器插件
39 1

热门文章

最新文章