1. 初步确认与信息收集
步骤1:确认掉线范围(单台/机架/机房/ISP区域)。
步骤2:查看监控告警(Ping、HTTP、SNMP、主机监控)并记录告警时间与波动。
步骤3:获取最近变更记录、运维工单、维护窗口与带宽利用率历史(避免误判人为改动)。
2. 远程连通性与基础网络测试
步骤1:从不同位置测试目标IP:ping -c 5 <目标IP>;traceroute -n <目标IP> 或 mtr -rw <目标IP>。
步骤2:若丢包或跳点异常,使用 tcpdump -i eth0 -nn -s0 -c 200 'host <目标IP>' 捕获数据包,判断是否到达本端。
步骤3:测试端口连通性:nc -vz <目标IP> 22 / 80 / 443 或 curl --max-time 10 http://<目标IP>。
3. 数据中心与交换层检查(虚拟/物理都适用)
步骤1:通过远程控制台或厂商管理卡(iLO、DRAC、IMM)登录主机控制台。
步骤2:检查交换机端口状态(Cisco举例):show interface status;show interface
counters;show logging。
步骤3:确认链路灯、端口速率与双工,若异常尝试重插网线或换用交换机上备份端口,并记录变更。
4. 光纤与SFP相关排查(常见于香港机房多光纤链路)
步骤1:检查光模块(SFP)物理插拔后重试,注意静电与防尘帽。
步骤2:使用光功率计或厂商show interface transceiver命令核验发射/接收功率是否正常。
步骤3:对怀疑纤缆使用视觉故障定位器(VFL)或替换已知良好纤缆/SFP验证是否恢复。
5. 主机系统与硬件诊断
步骤1:检查系统日志:dmesg | tail -n 100、journalctl -xe、/var/log/messages,关注网卡驱动、硬盘、温度和电源错误。
步骤2:查看网卡状态:ip link show;ethtool eth0 查看速率与错误计数;ethtool -S eth0 查看统计。
步骤3:硬盘与RAID:smartctl -a /dev/sdX;检查RAID事件,若遇硬盘或控制器故障按机房流程更换并重建。
6. 路由、BGP与上游ISP排查
步骤1:检查路由表与邻居:ip route show;在边界路由器:show ip bgp summary / show bgp neighbors。
步骤2:确认是否为BGP路由篡改或上游故障,使用ISP提供的looking glass或公开BGP查看器核对路由是否被宣布。
步骤3:若为上游问题,记录时间与证据,上报ISP并获取工单号;同时可临时切换备份链路或调整路由策略回避故障。
7. 现场操作与应急步骤(需机房人员配合)
步骤1:在机房由值班工程师执行物理检查:确认电源与UPS、PDU指示灯、风扇与温控。
步骤2:按变更管理先备份配置/快照后可进行有序重启:先重启交换设备再重启服务器,避免双向同时操作导致更大影响。
步骤3:如需更换部件(网卡、SFP、线缆、硬盘),先在非业务时间或将流量切换至备机,完成后验证并记录资产变更。
8. 问:遇到香港机房链路间歇性丢包,我应先做什么?
回答:先从远端进行mtr -rw <目标IP>获取逐跳丢包趋势,定位是机房内部还是上游链路。随后登录交换机查看接口错误(show interface )并检查光功率/链路灯;同时抓包(tcpdump)验证是否为流量高峰或DDoS,若怀疑上游问题立即联系ISP提供trace与logs。
9. 问:如果服务器完全无法远程管理(控制台也连不上),如何处理?
回答:请求机房现场人员通过管理卡(iLO/DRAC)或KVM物理接入查看控制台,如果管理卡也无响应检查机架PDU电源状态并尝试断电10秒后通电;若仍无响应,按机房流程更换电源线或联系厂商远程支持。
10. 问:排查完成后如何做总结与防范措施?
回答:整理事件时间线、故障根因、采取的临时与永久修复措施、影响范围与恢复时间,并在监控中加入阈值/熔断规则、备份链路、定期光纤与SFP检查、硬件冗余与演练计划,最后形成SOP以便下次快速响应。
来源:常见硬件与网络故障导致香港的服务器掉线的排查方法