适用场景

容灾项目的成败不在设备,而在"演练":很多单位花大价钱建了灾备中心,真出事时不敢切、切过去起不来。

配置步骤(数据复制与延迟监控)

# 监控项
# 1) 复制链路状态与延迟(秒/字节)
# 2) 复制队列积压
# 3) 存储双活链路带宽利用率
# 4) 数据库主从延迟(show slave status / pg_stat_replication)

关键参数与建议

  • 先定 RTO/RPO,再选技术方案;不同业务可以不同级别
  • 同城双活解决设备级/机房级故障,异地灾备解决区域性灾难
  • 数据复制要监控延迟,延迟超阈值必须告警(否则 RPO 不可信)
  • 切换演练分桌面推演、局部切换、全量切换,逐步推进
  • 演练要有回切方案,切过去能切回来才算完成

容易踩的坑

  • 只看链路 up,不看延迟,实际 RPO 远超设计值
  • 复制带宽被备份任务抢占
  • 无延迟告警,问题长期存在无人知

验证与巡检

# MySQL
show slave status\G | grep -i seconds_behind
  • 巡检:延迟 < 设计阈值、带宽余量 >30%、告警有效

小结

容灾的验收标准是"真敢切":约定演练频率、明确决策人、记录切换耗时与数据丢失量。没演练过的容灾等于没有。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。