如何避免虚拟基础设施单点故障

简介:

墨菲法则提到如果某事可能会出错,那么这件事一定会出错。可能没有比服务器虚拟化更严格遵守该法则的领域了。数据中心只有物理服务器时,服务器故障通常只影响一个工作负载。而虚拟主机运行多个工作负载,这意味着可能导致很多应用会出现故障。

使用服务器虚拟化的大多数企业利用诸如故障切换集群或者复制技术作为应对hypervisor级故障的方式。然而这类技术在保护虚拟负载方面还有很长的一段路要走,因为集群往往不够。即使构建了虚拟主机高可用集群仍然可能出现故障。如果某些虚拟基础设施成为单点故障,那么故障可能会发生。

尽管消除所有能够想到的单点故障是有可能的,但这需要雄厚的资金支持。在大多数情况下,企业必须识别潜在的风险,然后评估风险转换为实际问题的可能性。企业可能要花钱应对最大的风险。

这也引发了一个问题,那就是存在的潜在单点故障是什么。真正的故障风险可能变化多端,这取决于使用哪家厂商的产品以及虚拟基础设施是如何部署的。某些风险与硬件相关,某些与软件相关。

与硬件相关的发生故障可能会影响整个虚拟基础设施的所有硬件。以电源管理为例,很多虚拟主机配置了冗余的电源模块,当一个电源模块发生故障,第二个电源模块能够在线接管,这样就不会影响主机服务器,即便这样,管理员必须考虑电源一旦出现故障带来的的后果。

虚拟主机通常连接到UPS,在电力故障时能够使用发电机发电。然而,如果在主电源发生故障时,所有的服务器连接到同一个发电机,那么该发电机也可能成为潜在的单点故障。

这时就要进行风险评估。在备用的发电机出现故障影响整个虚拟基础设施前,很多事情都会出错,此时必须中断电源。不必将备用发电机出现故障放在心上,因为备用发电机成为单点故障的可能性非常小。

正如前文所说,尽管消除所有可能的单点故障是有可能的,但代价非常大。可以想象一下为各种各样的服务器配置单独的备用发电机的场景。,即使是这样也不一定会消除潜在的单点故障。如果这些备用发电机的燃料都来自于同一个地方,而燃料恰好被水污染了,那么发电机燃料将会成为单点故障。需要注意的是,很多事情可能会在发生其他故障之前出现问题。

在集群环境中,共享存储成为单点故障更为常见。集群存储通常配置了冗余的磁盘,当冗余未达到要求时,阵列、交换机、线缆可能会出现故障。

在软件端,如果未采用冗余方式部署,那么基础设施服务器可能成为单点故障。例如,假定企业打算部署System Center Virtual Machine Manager(SCVMM)作为管理Hyper-V的工具。SCVMM可能会成为单点故障,除非被部署在高可用性虚拟机上。同样地,SCVMM依赖的SQL Server数据库也可能成为单点故障,除非数据库也是冗余的。其他潜在的单点故障可能包括DNS服务器、域控制器、DHCP服务器、备份服务器或者互联网网关。

对大多数企业来说,消除所有可能的单点故障是不可能的,更好的策略是识别出单点故障,然后针对单点故障的风险等级进行评估。


本文作者:张冀川

来源:51CTO

相关文章
|
JavaScript 前端开发 API
探索后端技术:Node.js的优势和实际应用
【10月更文挑战第6天】 在当今数字化时代,后端开发是任何成功软件应用的关键组成部分。本文将深入探讨一种流行的后端技术——Node.js,通过分析其核心优势和实际应用案例,揭示其在现代软件开发中的重要性和潜力。
644 2
|
11月前
|
机器学习/深度学习 人工智能 监控
《C++赋能智能摄像头:开启实时视频分析新纪元》
在科技飞速发展的今天,智能摄像头结合人工智能技术,实现了人员识别、行为分析和异常事件预警等强大功能。C++凭借其高效性和对底层资源的出色掌控能力,成为将人工智能模型部署到智能摄像头的关键技术之一。本文深入探讨了如何在C++中实现这一目标,解锁智能摄像头的无限潜能。文章详细介绍了智能摄像头与人工智能的结合带来的需求与挑战,C++的独特优势,以及模型选择与优化、环境搭建与依赖配置、数据传输与预处理、模型集成与实时分析等关键技术要点。最后,提出了应对复杂环境和提升性能的策略,并展望了未来的发展前景。
293 18
|
11月前
|
JSON API 数据处理
如何运用获得京东商品详情API接口搬运商品到自己的电商平台?(一篇文章全搞定)
本文介绍如何利用京东商品详情API接口,将商品信息高效搬运至第三方电商平台。主要内容包括:前期准备(注册账号、申请权限、阅读文档、技术准备),API接口调用(构造请求URL、发送请求、解析返回数据、调用频率限制),数据处理与上架(清洗整理、分类设置、信息上传、商品审核),定时更新与维护(更新商品信息、信息维护、错误处理与日志记录),以及案例分析和优化建议。通过合理使用该接口,可提高运营效率,丰富商品种类,增强平台竞争力。
342 13
|
11月前
|
数据挖掘
国产CRM系统精粹:销售易、悟空CRM、金蝶的深度对比分析
在企业数字化转型中,CRM系统成为提升竞争力的关键工具。本文深度解析国产CRM系统的三个知名品牌:销售易、悟空CRM与金蝶。 **销售易**:覆盖营销、销售、服务全流程,支持全渠道获客、潜客识别、营销自动化及AIGC技术应用,适合大型和跨国公司。 **悟空CRM**:以易用性和灵活性著称,提供客户管理、销售跟踪、市场营销和服务支持功能,适合预算有限的中小企业。 **金蝶**:集成财务管理软件,提供云服务、定制化解决方案和强大的数据分析功能,适合已使用金蝶财务管理软件的企业。 这三款CRM系统各具特色,企业应根据自身需求选择合适的工具,以实现客户关系的全面管理,提升业务效率和客户满意度。
|
缓存 JavaScript
pinia必看避坑指南:几行代码规避隐藏bug!非常重要!
【10月更文挑战第16天】pinia必看避坑指南:几行代码规避隐藏bug!非常重要!
131 4
pinia必看避坑指南:几行代码规避隐藏bug!非常重要!
|
敏捷开发 Devops 测试技术
自动化测试中的持续集成与持续部署
在现代软件开发实践中,自动化测试是确保软件质量和快速迭代的关键。本文将探讨自动化测试如何与持续集成(CI)和持续部署(CD)流程相结合,以提高开发效率和软件质量。我们将分析CI/CD管道中自动化测试的最佳实践,以及如何克服实施过程中的挑战。
200 6
|
SQL 存储 分布式计算
Hive和Pig的区别是什么?如何选择?
【10月更文挑战第9天】Hive和Pig的区别是什么?如何选择?
301 0
|
机器学习/深度学习 分布式计算 监控
大模型开发:你如何使用大数据进行模型训练?
在大数据模型训练中,关键步骤包括数据准备(收集、清洗、特征工程、划分),硬件准备(分布式计算、并行训练),模型选择与配置,训练与优化,监控评估,以及模型的持久化与部署。过程中要关注数据隐私、安全及法规遵循,利用技术进步提升效率和性能。
2562 2
|
负载均衡 Java API
SpringCloud Alibaba详解
服务治理 服务治理就是进行服务的自动化管理,其核心是服务的自动注册与发现。 服务注册:服务实例将自身服务信息注册到注册中心。 服务发现:服务实例通过注册中心,获取到注册到其中的服务实例的信息,通过这些信息去请求它们提供的服务。 服务剔除:服务注册中心将出问题的服务自动剔除到可用列表之外,使其不会被调用到。
522 0
|
Kubernetes 负载均衡 Serverless
通过EDAS部署并访问应用
本实验旨在通过使用分布式应用服务EDAS纳管容器服务ASK,掌握微服务应用的部署和访问。

热门文章

最新文章