适用场景
告警的价值在于"可信"。一天 500 条告警的团队,一定会忽略真正的故障。治理目标是把无效告警降到最低。
配置步骤(告警收敛与依赖抑制)
# Zabbix 依赖示例:主机依赖交换机,交换机告警时抑制主机告警
# Prometheus Alertmanager 抑制规则
inhibit_rules:
- source_match: { severity: critical, alertname: SwitchDown }
target_match: { severity: warning }
equal: [instance_domain]
关键参数与建议
- 分级:P1 电话 + 群 + 工单;P2 群 + 工单;P3 仅工单
- 收敛:同一故障重复告警合并(如按主机+指标聚合)
- 依赖抑制:父主机/网络设备告警时抑制子告警
- 静默与维护窗口:变更期间自动静默
- 治理节奏:每月复盘 Top 告警,误报要么修要么删
容易踩的坑
- 网络抖动引发上百台主机告警,无人能看
- 未配抑制,告警互相淹没
- 收敛过度,真实告警被合并丢弃
验证与巡检
# 观察:一次网络故障后的告警总数
- 巡检:告警风暴次数、收敛规则有效性
小结
告警治理的验收指标:告警总量下降、有效告警比例提升、P1 告警 100% 有人处理。三个月不治理,告警就会回到"没人看"的状态。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。