本文概述了在阿里云香港节点上运行的 VPS 的日常运维与故障排查要点,包括应关注的监控指标、日志与网络检查方法、常见故障的定位流程和预防建议,旨在帮助运维人员快速定位问题并降低服务中断时间。
日常监控应优先关注 CPU、内存、磁盘使用率、磁盘 I/O、网络带宽与延迟、进程状态和端口可用性。建议将日常监控的阈值设置为:CPU 平均 5 分钟负载超过 80%、内存可用率低于 20%、磁盘使用率超过 80%(或 inode 超过 90%)、磁盘 I/O 等待时间显著上升以及出入流量异常。对运行数据库或缓存的实例,还需监控慢查询、连接数和缓存命中率。
推荐使用阿里云自带的 CloudMonitor 做基础监控,结合 Prometheus + Grafana 做细粒度指标展示与告警。轻量方案可用 Zabbix、Netdata 或者基于 CloudInit 的采集脚本上报到第三方。日志方面推荐统一接入 ELK(Elasticsearch/Logstash/Kibana)或 Loki。无论选择哪种方案,都要配置告警通知到电话/微信/钉钉/邮件并定义抖动与恢复策略以避免告警风暴。
日志是排查的核心。先检查系统日志(/var/log/messages、/var/log/syslog、journalctl)、应用日志和 web 日志(nginx、apache)。使用 journalctl -u 服务名 查看 systemd 服务日志;tail -f 实时观察;grep + 时间窗口筛选异常。对于阿里云环境,也可启用云监控日志服务(Log Service)进行集中化存储与检索,便于跨实例聚合与长期追溯。
遇到网络异常先从宿主内核和实例网络接口开始排查:使用 ip addr、ip route、ss -tunlp、ethtool 查看网卡与路由配置;用 ping、mtr/traceroute 确认到网关与目标的延迟与丢包;tcpdump 捕获流量,定位丢包或异常包。注意香港节点常受国际带宽与 ISP 路由影响,必要时对比同区域其他实例或向阿里云工单查询 BGP 路由与带宽抖动信息。
短时宕机常见原因包括:资源耗尽(CPU/内存/磁盘满或 I/O 饱和)、应用死锁或线程泄露、异常流量或 DDoS、系统或内核升级导致的重启、以及磁盘 inode 用尽或文件句柄耗尽。还要排查安全相关问题如被入侵后进程异常、iptables/nftables 配置错误或防火墙策略误阻断。
排查建议按顺序进行:1)快速确认影响面:单实例、同一子网还是整个区域;2)查看监控与告警历史,定位异常时间点;3)检查系统资源(top、free、iostat、df -h、df -i);4)查看服务状态和最近日志(systemctl status、journalctl、应用日志);5)网络诊断(ping/mtr/tcpdump);6)若为配置或软件问题,回滚到最近稳定配置或重启服务;7)必要时执行垂直扩容或临时迁移流量。整个过程记录每一步并在恢复后进行根因分析(RCA)。
推荐指标轮询频率 30s 到 1min;告警策略采用短期和长期结合,例如 CPU 连续 5 分钟 >80% 触发预警,连续 30 分钟触发严重告警。磁盘和 inode 建议 80%/90% 两级阈值;内存可用低于 20% 并伴随 swap-intensive 时触发。网络丢包率持续 >2%-5% 或响应时间突增也应告警。合理设置抑制与重复触发间隔,避免告警泛滥。
预防措施包括:定期做系统与应用补丁、设置日志轮转与归档(logrotate)、配置监控与自动扩容策略、限制单进程最大资源消耗、开启 fail2ban 限制暴力登录、定期备份并演练恢复流程、使用读写分离或负载均衡减少单点压力。对于阿里云香港节点,还要注意跨境带宽与域名解析优化(DNS 多地解析)。
遇到流量激增先启动流量缓解:启用阿里云的 DDoS 防护、Web 应用防火墙(WAF)与 CDN 缓存,临时增加实例或启用弹性伸缩。快速限流可以在 nginx/应用层加入 rate limit,或通过阿里云安全产品做 IP 黑名单/白名单过滤。并结合流量分析找出异常来源、及时封禁并将详细抓包文件上传至分析平台。