1.
整体原则与准备工作
- 明确SLA与RTO/RPO目标:例如可用性99.99%、RTO ≤ 5分钟、RPO ≤ 1分钟。
- 建立关键设备清单(机柜号、U位、IP、串口、保修/合同)。把清单放到CMDB并定期校验。
- 制定权限与BOM:谁能进机房,谁能重启设备,谁能改配置。准备应急联系人清单并保持24/7可达。
2.
电力与不间断供电(UPS/柴油发电机)
- 配置:双路市电输入、双路PDU到机柜,关键机柜双电源A/B接入不同UPS。UPS容量按峰值负载120%冗余。
- 操作步骤:每季度进行一次UPS电池自放电测试;模拟切换测试:在维护窗口用切换负载到UPS电源,观察是否有断电或波动(记录电压、电流、转瞬停机日志)。
- 发电机测试:每月冷启动一次,季度满载测试(或至少70%模拟负载)30分钟,记录燃油消耗与自动转接时间。
3.
机柜与冷却策略
- 机柜布局:冷热通道封闭、热通道安装墙板,冷通道设置空出至少20%风道。关键设备集中放置以便流量控制。
- 冷却冗余:配置N+1或2N空调,监控温度和湿度传感器,阈值报警(例如温度超出27°C触发告警)。
- 操作:每月检查空调过滤网、风速,记录CRAC单元循环时间与能效比,发现风速下降即清洁或更换滤芯。
4.
服务器硬件选型与冗余
- 选型:选择支持ECC内存、带热插拔冗余电源和风扇的企业级机型。CPU/内存按负载留30%-50%余量。
- 磁盘与RAID:采用多盘RAID(RAID10优先),使用企业级SSD/HDD并启用SMART监控。定期使用smartctl -a /dev/sdX检查SSD健康。
- 操作:启用机箱级远程管理(iDRAC/iLO),配置固件自动更新策略并在维护窗口执行,记录BIOS/固件变更。
5.
存储架构与数据复制
- 本地高可用:使用RAID + LVM快照或企业级存储阵列(FC/iSCSI),设置异构副本策略。
- 异地复制:同步或近同步复制到备机房(例如香港主站与离岸DR),使用存储厂商复制或ZFS/RSYNC+增量快照。确保带宽和延迟满足RPO。
- 操作:定期验证快照可恢复(每周随机恢复文件/数据库一小部分),并记录恢复时间。
6.
操作系统与数据库调优
- 内核与BIOS调优:调整网络缓冲区(net.core.rmem_max、wmem_max)、关闭C‑states或调整节能策略以减少延迟。把关键参数写入/etc/sysctl.conf并sysctl -p。
- 文件系统与IO优化:使用XFS或EXT4调优挂载参数(noatime,nodiratime), 为数据库设置专用LVM或挂载点。
- 操作:建立基准测试(fio for IO,sysbench for DB),每次变更后进行回归测试并记录结果。
7.
虚拟化/容器与集群高可用
- 虚拟化:主备(Active-Standby)或Active-Active架构,vSphere/Hyper‑V/KVM等使用共享存储和实时迁移(vMotion)。
- 容器化:Kubernetes多master部署,etcd三节点或五节点奇数个数,使用PodDisruptionBudget与资源限制。
- 操作:定期演练主节点故障切换(在非交易时段)并验证服务无缝迁移,记录故障切换时间与数据一致性。
8.
网络拓扑与物理冗余
- 拓扑:边缘交换机→汇聚交换机(冗余)→核心路由器(双主/双电源)。跨机柜双链路,链路走不同光纤路径。
- 设备选择:选择支持热插拔电源、冗余风扇、支持MLAG/Stacking的企业交换机与高性能防火墙。
- 操作:实现链路聚合(LACP),并验证单链路中断不会造成丢包或环路。定期检查光纤接头(清洁)与SFP模块状态。
9.
网络配置示例:NIC Bonding、VRRP与BGP
- NIC Bonding(Linux):配置mode=4 (802.3ad)。示例(Debian/Ubuntu netplan或ifcfg):确保交换端配置LACP,然后在主机执行
- ip link add bond0 type bond; ip link set eth0 master bond0; ip link set eth1 master bond0; echo 802.3ad > /sys/class/net/bond0/bonding/mode; ip addr add 10.0.0.10/24 dev bond0; ip link set bond0 up
- VRRP(keepalived)示例:配置两个节点,虚IP漂移,healthcheck脚本监控后端服务,priority高的成为MASTER。
- BGP:与上游ISP建立BGP会话,使用多宿主与AS‑PATH策略,实现故障自动回收与流量引导(配合社区与MED)。
10.
边界防护、DDoS与WAF
- 边界防火墙:采用状态防火墙+IPS,建立白名单、速率限制与会话限制规则。
- DDoS防护:与云厂商或专门清洗服务接入(按需或Always‑On),设置流量阈值自动转发到清洗中心。
- WAF与应用防护:对交易API、登录路径配置WAF规则,启用TLS 1.2/1.3并使用HSTS,定期漏洞扫描并修补。
11.
监控、告警与演练
- 监控要素:主机(CPU、Mem、IO)、网络(丢包、延迟、利用率)、服务(连接数、交易延迟)、硬件(温度、电池容量)。建议使用Prometheus+Grafana、Zabbix或商用套件。
- 告警策略:分级告警(Info/Warning/Critical),明确接收人和Escalation路径,配合电话/短信/即时通信与Runbook。
- 演练:每季度一次故障演练(断电、链路切断、数据库主备切换),并写成Post‑mortem,补齐流程漏洞。
12.
运维SOP与变更管理
- SOP要点:变更前评估影响、回滚计划、维护窗口、通知受影响方、变更记录。使用工单系统审批。
- 日常检查:每天检查关键告警、每周检查固件补丁、每月健康检查并记录(电池、温度、日志)。
- 紧急恢复步骤:把关键命令、串口登录信息、物理钥匙位置写入紧急文档并放置离线纸本与可信电子备份。
13.
问:如何确保网络链路切换对交易延迟影响最小?
- 答:采用LACP绑定+多路径路由(BGP/ECMP)并在交换机上实现快速收敛(降低STP超时),在主机端使用 bonding mode=802.3ad 与适配器硬件卸载。对交易层使用会话保持(sticky session)或分层负载均衡,事先在非生产环境做链路失效压力测试,测量并优化交易超时时间。
14.
问:如果主数据中心发生灾难,最快的故障切换步骤是什么?
- 答:1) 立即启动DR Runbook并通知所有相关负责人;2) 将路由/流量通过BGP撤回并指向DR站点的公网IP(预先准备好BGP社区/策略);3) 在DR站点提升数据库为主并验证数据一致性,恢复交易服务;4) 在切换过程中维持只读或降级模式以保护数据,完成后执行完整回溯与Post‑mortem。
15.
问:平时运维中最容易忽视但会导致重大故障的问题是什么?
- 答:常见被忽视项包括固件不一致(交换机/服务器/存储不同版本可能引发兼容问题)、UPS电池未定期测试、演练不足(变更没做回滚测试)、以及单点操作权限过多。建议建立周期性固件一致性检查、UPS与发电机演练、以及每次变更前做回滚验证。
来源:从硬件到网络层面保障香港交易所机房服务器运行稳定