适用场景

监控的价值不在图好看,而在"出问题之前有人知道"。最小闭环是:关键指标有采集、阈值有依据、告警能到人、处理有记录。

配置步骤(Zabbix 接入)

# Agent 端
rpm -Uvh zabbix-release.rpm
yum install -y zabbix-agent
sed -i 's/^Server=.*/Server=10.0.10.30/' /etc/zabbix/zabbix_agentd.conf
systemctl enable --now zabbix-agent
# 网络设备:SNMP v3 采集
# 交换机侧(H3C)
snmp-agent sys-info version v3
snmp-agent usm-user v3 zbxuser zbxgroup authentication-mode sha 认证口令 privacy-mode aes128 加密口令

关键参数与建议

  • 先监控"会立刻影响业务"的指标:存活、端口、磁盘、证书、核心业务接口
  • 阈值分级(警告/严重),避免全天候刷告警导致麻木
  • 告警必须能到达值班人(电话/短信/企业微信),并定义响应时限
  • 网络设备用 SNMP v3 或只读账号,避免用管理员账号采集
  • 监控自身要冗余:监控服务器故障时无人值守等于没监控

容易踩的坑

  • Agent 时间与 Server 不一致,数据时间错乱
  • SNMP 用 v1/v2c 明文团体字,被扫描到即可读全网设备
  • 只监控 CPU 内存,磁盘与证书到期没人管

验证与巡检

zabbix_get -s 10.0.10.31 -k system.uptime
snmpwalk -v3 -l authPriv -u zbxuser -a SHA -A 认证口令 -x AES -X 加密口令 设备IP sysUpTime
  • 巡检:主机可用性 100%、关键触发器有告警记录、SNMP v3 生效

小结

告警治理是长期动作:每月盘点一次告警,把误报调掉、把漏报补上、把长期忽略的告警删掉或升级。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。