负载均衡故障排错指南 (5)-阿里云开发者社区

开发者社区> 科技小能手> 正文

负载均衡故障排错指南 (5)

简介:
+关注继续查看
故障排查方法论
 
故障排查方法
简单的来说,故障排错的方法很简单:说明问题,分析问题,解决问题。在这三个步骤中,分析问题花费的时间最多,说明问题却最容易被我们忽略,而解决问题则相对简单。
 
  • 说明问题
当问题发生后,我们应该做的第一件事是尽快收集信息,确定问题的现象以及造成的影响。有时候,我们还需要利用一些工具做一些对比测试,以进一步对问题进行确认。
通常情况下,我们可以通过回答以下问题来对问题进行进一步的定位:

·   出现问题的是一直在用的应用还是新上线的应用?

·   在问题出现之前一段时间,网络或应用是否进行过调整?

·   什么类型的应用出了问题?对应的VIP地址是什么?可能的话,判断可能出问题的功能模块。

·   确定问题发生的频度,是经常发生,偶尔发生还是总是发生?

·   确定问题的影响范围,是所有用户都遇到同样的问题,还是只有某些固定的用户遇到问题,还是部分用户(不固定)遇到这样的问题?

  • 分析问题
通过分析上述问题的答案,我们可能对问题有一个初步的判断。并大致的对问题进行定位。我们假设可能导致问题的种种原因,并通过进一步的信息收集,或采用工具来做一些简单的测试,验证自己的猜想。当测试的结果与自己的猜想一致时,你可能就找到的导致问题的原因。
这个方法很简单,但是却需要工程师对相关的网络知识有比较深入的理解——注意,我这里用得是“理解”二字。因为,只有你真正理解了这些基本的原理,分析问题时才会得心应手。
在这里,我跟大家分享一个“简单”的训练方法,能够帮助我们更加深入的理解网络中的这些基本原理。
想象一下,这个网络中只有三个简单的元素:客户端PC、交换机、Web服务器。如果客户端通过浏览器来访问服务器,你能否充分发挥你的想象能力,想象一下整个数据在终端、交换机、服务器上的处理流程?
 
最简化版:
客户端发送HTTP请求,通过交换机转发至Web服务器,然后Web服务器响应请求。
 
这种描述方式可能是最简单的了,但是,对于网络工程师来说,却是无用了。我们可以对这个描述进行一些细化:
 
简单版:

·  客户端首先与服务器建立TCP连接

·  客户端在该TCP连接中发送HTTP请求

·  服务器收到请求后,将响应内容返回给客户端

 
有点意思了。至少,我们知道HTTP请求是封装在TCP协议里的。还能再细化一点吗?当然可以。
 
TCP交互版:

·  客户端首先向服务器发送TCP SYN数据包,请求建立TCP连接。

·  服务器返回客户端SYN+ACK

·  客户端向服务器发送ACK数据包,TCP三次握手成功。

·  客户端向服务器发送HTTP请求

·  服务器向客户端返回ACK数据包,确认请求收到。

·  服务器向客户端返回响应内容。

·  客户端向服务器返回ACK数据包,确认响应内容收到。

·  服务器响应内容发送完毕,发送FIN1来终结TCP连接

·  客户端收到FIN1后,应答FIN1+ACK,并发送FIN2关闭TCP连接

·  服务器收到FIN2后,应答FIN2+ACK,TCP连接关闭

 
在这个版本中,我们已经比较清晰的分析了TCP协议的交互过程。还能再进一步细化吗?回答是:当然可以。这一次,我们将加入二层的一些交互分析。
 
ARP交互版:
想象一下,你的PC客户端是一台刚刚开机,配置了静态IP地址。当你在浏览器中输入服务器地址时,PC、交换机、服务器之间会怎么交互呢?

·  PC会根据自己的掩码和地址,来判断你要访问的服务器IP地址与自己是否属于同一网段。

·  如果属于同一网段,则查询本地的ARP缓存,查找服务器IP对应的MAC地址。

·  如果找不到,PC会通过网卡发送一个ARP查询广播报文,源MAC为自身,目标MAC为FF:FF:FF:FF:FF:FF。

·  服务器收到了这个ARP的查询广播后,会通过单播的方式,向PC终端发送一个ARP查询应答,告诉PC,自己就是它要找的那台服务器。

·  PC收到ARP应答后,会将该IP与MAC的对应关系放入自己的ARP缓存系统中。

·  然后,PC会将TCP SYN封装成数据帧,目的MAC为服务器MAC地址,并将该数据帧转发给交换机。

·  同样,交换机在收到各种数据帧后,会将源MAC与端口的对应关系,放入自己的MAC-ADDRESS-TABLE中。这样,下次再收到数据帧后,查询自己的MAC与端口对应关系表,就可以进行快速转发了。

·  交换机将TCP SYN数据帧转发至服务器所在的端口。

·  服务器收到TCP SYN之后,后续将按照前面所描述的那样,二者之间进行三次握手、发请求、响应、关闭连接。

 
当然,这里只有简单的三个元素,在复杂的网络环境中,你可以想象网络中的数据从PC生成,在各种设备中的处理过程。你想的越仔细,那么,你就越容易找到可能导致问题的原因。
 
当然,在真正出现问题时,我们需要在最短的时间内找到导致问题的原因。因此,你可以对这些交互过程进行一些简化,重点对你怀疑的环节进行分析,尽量弄清楚设备在这个环节上的处理规则,并通过设计一些小的实验来验证自己的猜想。
 
  • 解决问题
找到了导致问题的原因,那么解决问题就相对比较简单了。当然,有时候,受限于当时的环境和条件,我们可能无法彻底解决问题,那么,也可以采用一些临时的解决方案,来临时的解决问题,这个就要针对具体的问题具体分析了。
 
常见的故障排查原则

· 自底向上的排查方法

自底向上的排查方法与网络协议的分层设计有关,从物理层开始,逐层向上进行排查,并逐层排除可能导致问题的原因。比如:用户报告说无法访问服务器了,那么,从服务器与交换机的连接线开始,首先查看物理层的端口的状态指示灯,然后检查交换机、服务器上的链路状态,然后检查ARP表、路由表等等,这样一层层向上进行排查,并最终对问题进行定位。

· 分而治之的排查方法

在某些比较大的网络中,自底向上的排查方法可能会显得比较复杂,因此,可以采用ping的方式,对可能出现问题的层次进行判断。如果能够ping通,至少说明网络层以下是没有问题的,问题可能出现在上层;否则,如果ping不通,则说明问题可能出现在网络层以下。

· 数据流追踪法

对于负载均衡设备来说,大部分的问题可能都是来自于网络层之上的。因此,通过抓包工具来追踪数据流的处理过程,对于故障排查排查和分析来说,也是一个非常有效的方法。

· 配置比较法

有时候,如果怀疑配置可能有变化,那么,与原来备份的配置进行一些比较,也许也能够找到一些线索。

· 模块替换法

模块替换法经常用于可疑的硬件故障。比如:通过替换光模块,我们可以判断是否是光模块的损坏而导致的问题。
 
在接下来的章节中,我将带大家利用这个方法论和常见的故障排查原则,结合一些案例,来介绍常见的负载均衡问题及排查方法。

 



本文转自 virtualadc 51CTO博客,原文链接:http://blog.51cto.com/virtualadc/752431

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
阿里云服务器怎么设置密码?怎么停机?怎么重启服务器?
如果在创建实例时没有设置密码,或者密码丢失,您可以在控制台上重新设置实例的登录密码。本文仅描述如何在 ECS 管理控制台上修改实例登录密码。
8522 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,大概有三种登录方式:
2803 0
阿里云服务器ECS远程登录用户名密码查询方法
阿里云服务器ECS远程连接登录输入用户名和密码,阿里云没有默认密码,如果购买时没设置需要先重置实例密码,Windows用户名是administrator,Linux账号是root,阿小云来详细说下阿里云服务器远程登录连接用户名和密码查询方法
10940 0
阿里云服务器端口号设置
阿里云服务器初级使用者可能面临的问题之一. 使用tomcat或者其他服务器软件设置端口号后,比如 一些不是默认的, mysql的 3306, mssql的1433,有时候打不开网页, 原因是没有在ecs安全组去设置这个端口号. 解决: 点击ecs下网络和安全下的安全组 在弹出的安全组中,如果没有就新建安全组,然后点击配置规则 最后如上图点击添加...或快速创建.   have fun!  将编程看作是一门艺术,而不单单是个技术。
10359 0
使用OpenApi弹性释放和设置云服务器ECS释放
云服务器ECS的一个重要特性就是按需创建资源。您可以在业务高峰期按需弹性的自定义规则进行资源创建,在完成业务计算的时候释放资源。本篇将提供几个Tips帮助您更加容易和自动化的完成云服务器的释放和弹性设置。
11902 0
windows server 2008阿里云ECS服务器安全设置
最近我们Sinesafe安全公司在为客户使用阿里云ecs服务器做安全的过程中,发现服务器基础安全性都没有做。为了为站长们提供更加有效的安全基础解决方案,我们Sinesafe将对阿里云服务器win2008 系统进行基础安全部署实战过程! 比较重要的几部分 1.
8758 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,阿里云优惠总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系.
12204 0
腾讯云服务器 设置ngxin + fastdfs +tomcat 开机自启动
在tomcat中新建一个可以启动的 .sh 脚本文件 /usr/local/tomcat7/bin/ export JAVA_HOME=/usr/local/java/jdk7 export PATH=$JAVA_HOME/bin/:$PATH export CLASSPATH=.
4556 0
阿里云服务器如何登录?阿里云服务器的三种登录方法
购买阿里云ECS云服务器后如何登录?场景不同,云吞铺子总结大概有三种登录方式: 登录到ECS云服务器控制台 在ECS云服务器控制台用户可以更改密码、更换系统盘、创建快照、配置安全组等操作如何登录ECS云服务器控制台? 1、先登录到阿里云ECS服务器控制台 2、点击顶部的“控制台” 3、通过左侧栏,切换到“云服务器ECS”即可,如下图所示 通过ECS控制台的远程连接来登录到云服务器 阿里云ECS云服务器自带远程连接功能,使用该功能可以登录到云服务器,简单且方便,如下图:点击“远程连接”,第一次连接会自动生成6位数字密码,输入密码即可登录到云服务器上。
21674 0
23706
文章
0
问答
文章排行榜
最热
最新
相关电子书
更多
《2021云上架构与运维峰会演讲合集》
立即下载
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载