适用场景
监控的价值不在图好看,而在"出问题之前有人知道"。最小闭环是:关键指标有采集、阈值有依据、告警能到人、处理有记录。
配置步骤(告警规则与值班机制)
# 告警规则示例(Prometheus 风格)
- alert: DiskWillFillIn4Hours
expr: predict_linear(node_filesystem_free_bytes[6h], 4*3600) < 0
for: 10m
labels: { severity: warning }
- alert: BackendDown
expr: probe_success == 0
for: 2m
labels: { severity: critical }
关键参数与建议
- 先监控"会立刻影响业务"的指标:存活、端口、磁盘、证书、核心业务接口
- 阈值分级(警告/严重),避免全天候刷告警导致麻木
- 告警必须能到达值班人(电话/短信/企业微信),并定义响应时限
- 网络设备用 SNMP v3 或只读账号,避免用管理员账号采集
- 监控自身要冗余:监控服务器故障时无人值守等于没监控
容易踩的坑
- 阈值写死(如磁盘 90%),业务特点不同导致误报或漏报
- 无分级,所有告警都打断值班人员
- 告警没有处理记录,同样的问题重复发生
验证与巡检
# 每月统计:告警条数、误报条数、平均处理时长
- 巡检:告警分级清晰、值班表与升级路径明确、月度复盘记录
小结
告警治理是长期动作:每月盘点一次告警,把误报调掉、把漏报补上、把长期忽略的告警删掉或升级。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。