适用场景
告警的价值在于"可信"。一天 500 条告警的团队,一定会忽略真正的故障。治理目标是把无效告警降到最低。
配置步骤(月度治理流程)
# 1) 统计 Top 告警(按规则/主机)
# 2) 分类:真实告警、误报、重复
# 3) 处置:误报调整阈值或删除、重复加收敛
# 4) 输出:治理报告与下月目标
关键参数与建议
- 分级:P1 电话 + 群 + 工单;P2 群 + 工单;P3 仅工单
- 收敛:同一故障重复告警合并(如按主机+指标聚合)
- 依赖抑制:父主机/网络设备告警时抑制子告警
- 静默与维护窗口:变更期间自动静默
- 治理节奏:每月复盘 Top 告警,误报要么修要么删
容易踩的坑
- 不统计,只知道「告警很多」
- 误报不处理,靠值班人员「习惯性忽略」
- 治理无目标,效果不可衡量
验证与巡检
# 证据:月度告警治理报告(总量/有效比例/Top 规则)
- 巡检:告警总量趋势下降
小结
告警治理的验收指标:告警总量下降、有效告警比例提升、P1 告警 100% 有人处理。三个月不治理,告警就会回到"没人看"的状态。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。