《大数据系统构建:可扩展实时数据系统构建原理与最佳实践》一1.10 总结

简介:

本节书摘来自华章出版社《大数据系统构建:可扩展实时数据系统构建原理与最佳实践》一书中的第1章,第1.10节,南森·马茨(Nathan Marz) [美] 詹姆斯·沃伦(JamesWarren) 著 马延辉 向 磊 魏东琦 译,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

1.10 总结

你已经知道了使用传统技术(如分片)来扩展关系型系统时会出现的错误。而我们面临的问题不仅仅是扩展,因为那会使系统变得更难以管理、扩展,甚至更难理解。在后面的章节中,当介绍如何构建大数据系统时,我们将像注重可扩展性一样注重鲁棒性。你将看到,当用正确的方式构建系统时,鲁棒性和可扩展性都是可以在同一个系统中实现的。
使用Lambda架构构建数据系统的好处不仅仅是可扩展,因为你的系统将能够处理更大量的数据、收集更多的数据并获得更多的价值。增加存储数据的数量和类型,将会有更多机会去挖掘数据、生成分析和构建新的应用程序。
使用Lambda架构的另一个好处是应用程序的健壮性很好。原因有很多,例如,你将有能力在整个数据集上运行计算来进行迁移或解决出错的事情。你永远不需要处理同一时间模式中有多个活跃版本的情况。当改变模式时,你将有能力将所有数据更新到新的模式。同样的,如果一个错误的算法被不小心部署到生产环境,破坏了所提供的数据,你可以通过重新计算被破坏的数值很容易地解决该问题。如你将见到的,还有许多其他原因使得大数据应用程序的鲁棒性更好。
最后,性能将是更加可预测的。虽然Lambda架构作为一个整体是通用和灵活的,但组成系统的各个组件是特定的。当与诸如SQL的查询计划比较时,后台很少会有“魔法”发生。这就使我们可以得到更加可预测的性能。
如果你对很多这种信息仍然不确定,也不用担心。我们还有很多内容需要进行探讨,并且将通过本书的课程再次深入讨论本章中介绍的每一个主题。在下一章中,你将开始学习如何构建Lambda架构。你会从堆栈的核心开始,即如何对数据集的主副本进行建模和系统化。

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
5月前
|
机器学习/深度学习 算法 大数据
构建数据中台,为什么“湖仓一体”成了大厂标配?
在大数据时代,数据湖与数据仓库各具优势,但单一架构难以应对复杂业务需求。湖仓一体通过融合数据湖的灵活性与数据仓的规范性,实现数据分层治理、统一调度,既能承载海量多源数据,又能支撑高效分析决策,成为企业构建数据中台、推动智能化转型的关键路径。
|
4月前
|
存储 SQL 分布式计算
MaxCompute 聚簇优化推荐原理
基于历史查询智能推荐Clustered表,显著降低计算成本,提升数仓性能。
327 4
MaxCompute 聚簇优化推荐原理
|
8月前
|
SQL 分布式计算 大数据
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
本文深入介绍 Hive 与大数据融合构建强大数据仓库的实战指南。涵盖 Hive 简介、优势、安装配置、数据处理、性能优化及安全管理等内容,并通过互联网广告和物流行业案例分析,展示其实际应用。具有专业性、可操作性和参考价值。
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
|
6月前
|
存储 SQL 分布式计算
MaxCompute x 聚水潭:基于近实时数仓解决方案构建统一增全量一体化数据链路
聚水潭作为中国领先的电商SaaS ERP服务商,致力于为88,400+客户提供全链路数字化解决方案。其核心ERP产品助力企业实现数据驱动的智能决策。为应对业务扩展带来的数据处理挑战,聚水潭采用MaxCompute近实时数仓Delta Table方案,有效提升数据新鲜度和计算效率,提效比例超200%,资源消耗显著降低。未来,聚水潭将进一步优化数据链路,结合MaxQA实现实时分析,赋能商家快速响应市场变化。
322 0
|
消息中间件 分布式计算 大数据
大数据-166 Apache Kylin Cube 流式构建 整体流程详细记录
大数据-166 Apache Kylin Cube 流式构建 整体流程详细记录
264 5
|
8月前
|
Cloud Native 大数据 Java
大数据新视界--大数据大厂之大数据时代的璀璨导航星:Eureka 原理与实践深度探秘
本文深入剖析 Eureka 在大数据时代分布式系统中的关键作用。涵盖其原理,包括服务注册、续约、发现及自我保护机制;详述搭建步骤、两面性;展示在大数据等多领域的应用场景、实战案例及代码演示。Eureka 如璀璨导航星,为分布式系统高效协作指引方向。
|
存储 SQL 分布式计算
大数据-162 Apache Kylin 全量增量Cube的构建 Segment 超详细记录 多图
大数据-162 Apache Kylin 全量增量Cube的构建 Segment 超详细记录 多图
239 3
|
传感器 人工智能 大数据
高科技生命体征探测器、情绪感受器以及传感器背后的大数据平台在健康监测、生命体征检测领域的设想与系统构建
本系统由健康传感器、大数据云平台和脑机接口设备组成。传感器内置生命体征感应器、全球无线定位、人脸识别摄像头等,搜集超出现有科学认知的生命体征信息。云平台整合大数据、云计算与AI,处理并传输数据至接收者大脑芯片,实现实时健康监测。脑机接口设备通过先进通讯技术,实现对健康信息的实时感知与反馈,确保身份验证与数据安全。
|
11月前
|
存储 分布式计算 物联网
美的楼宇科技基于阿里云 EMR Serverless Spark 构建 LakeHouse 湖仓数据平台
美的楼宇科技基于阿里云 EMR Serverless Spark 建设 IoT 数据平台,实现了数据与 AI 技术的有效融合,解决了美的楼宇科技设备数据量庞大且持续增长、数据半结构化、数据价值缺乏深度挖掘的痛点问题。并结合 EMR Serverless StarRocks 搭建了 Lakehouse 平台,最终实现不同场景下整体性能提升50%以上,同时综合成本下降30%。
875 58