适用场景

别人的故障是最好的教材。这四类事故(广播风暴、存储写满、证书过期、配置误改)在多数单位都发生过,复盘固定成模板可以直接用。

配置步骤(存储写满:数据库与业务同时不可用)

# 现象:数据库拒绝写入,上传功能失败
# 定位:
# 1) df -h 看分区使用率
# 2) du -sh 逐层定位大目录(日志/备份/上传)
# 处置:清理日志与临时文件,扩展分区
# 根因:日志未轮转 + 备份任务与业务同盘

改进:日志轮转与磁盘告警(80% 阈值)、备份独立存储、定期清理策略。

关键参数与建议

  • 复盘模板:时间线、现象、影响范围、根因、处置动作、改进项
  • 根因要追问到流程层面(为什么没提前发现)
  • 改进项必须落到具体动作与责任人
  • 把复盘沉淀成检查项,纳入日常巡检

容易踩的坑

  • 只删日志不做轮转,过几天又满
  • 备份与业务同盘,备份把系统写满
  • 无磁盘告警,发现时已经宕机

验证与巡检

df -h
find / -xdev -type f -size +500M -exec ls -lh {} \; 2>/dev/null | head
  • 巡检:磁盘使用率曲线、日志轮转配置、备份存储独立

小结

故障复盘的产出不是报告,而是"下次不会再发生同样的故障"的具体措施。没有改进项的复盘没有价值。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。