适用场景
容灾项目的成败不在设备,而在"演练":很多单位花大价钱建了灾备中心,真出事时不敢切、切过去起不来。
配置步骤(数据复制与延迟监控)
# 监控项
# 1) 复制链路状态与延迟(秒/字节)
# 2) 复制队列积压
# 3) 存储双活链路带宽利用率
# 4) 数据库主从延迟(show slave status / pg_stat_replication)
关键参数与建议
- 先定 RTO/RPO,再选技术方案;不同业务可以不同级别
- 同城双活解决设备级/机房级故障,异地灾备解决区域性灾难
- 数据复制要监控延迟,延迟超阈值必须告警(否则 RPO 不可信)
- 切换演练分桌面推演、局部切换、全量切换,逐步推进
- 演练要有回切方案,切过去能切回来才算完成
容易踩的坑
- 只看链路 up,不看延迟,实际 RPO 远超设计值
- 复制带宽被备份任务抢占
- 无延迟告警,问题长期存在无人知
验证与巡检
# MySQL
show slave status\G | grep -i seconds_behind
- 巡检:延迟 < 设计阈值、带宽余量 >30%、告警有效
小结
容灾的验收标准是"真敢切":约定演练频率、明确决策人、记录切换耗时与数据丢失量。没演练过的容灾等于没有。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。