适用场景
别人的故障是最好的教材。这四类事故(广播风暴、存储写满、证书过期、配置误改)在多数单位都发生过,复盘固定成模板可以直接用。
配置步骤(存储写满:数据库与业务同时不可用)
# 现象:数据库拒绝写入,上传功能失败
# 定位:
# 1) df -h 看分区使用率
# 2) du -sh 逐层定位大目录(日志/备份/上传)
# 处置:清理日志与临时文件,扩展分区
# 根因:日志未轮转 + 备份任务与业务同盘
改进:日志轮转与磁盘告警(80% 阈值)、备份独立存储、定期清理策略。
关键参数与建议
- 复盘模板:时间线、现象、影响范围、根因、处置动作、改进项
- 根因要追问到流程层面(为什么没提前发现)
- 改进项必须落到具体动作与责任人
- 把复盘沉淀成检查项,纳入日常巡检
容易踩的坑
- 只删日志不做轮转,过几天又满
- 备份与业务同盘,备份把系统写满
- 无磁盘告警,发现时已经宕机
验证与巡检
df -h
find / -xdev -type f -size +500M -exec ls -lh {} \; 2>/dev/null | head
- 巡检:磁盘使用率曲线、日志轮转配置、备份存储独立
小结
故障复盘的产出不是报告,而是"下次不会再发生同样的故障"的具体措施。没有改进项的复盘没有价值。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。