适用场景

存储出问题的代价通常比服务器大:一台服务器挂了业务还能切,存储挂了所有虚机和数据库一起躺。SAN 运维的核心就三件事:路径别断、盘别同时坏、性能基线心里有数。

配置步骤(多路径与链路冗余)

# 1) 主机侧多路径状态(Linux + DM-Multipath)
multipath -ll
# 关注:每条 LUN 是否 2 条以上 path,状态是否为 active ready

# 2) 路径故障演练前先确认
cat /etc/multipath.conf | grep -A5 'defaults'
lsblk -S                     # HBA 与盘符映射

# 3) 交换机侧核对:两条路径是否分别在不同交换机
# display interface brief | include <上行口>

# 4) 单链路断开演练(低峰执行,先备份业务)
# 断开 A 面交换机对应端口,观察:
#   - multipath -ll 中 path 变为 failed
#   - 业务 IO 不中断(时延允许短时上升)
#   - 监控产生链路告警而不是业务告警

关键参数与建议

  • 双控双路径:主机侧多路径(MPIO/multipath)必须启用,两条路径分别走不同交换机
  • RAID 策略:业务盘优先 RAID10 或 RAID6 + 热备盘,热备盘要定期检查是否真的在被使用
  • LUN 映射:命名与用途要能对应到业务(禁止 LUN01/02 这种命名),映射变更要留记录
  • 快照与克隆:快照不是备份,只用于短时回滚;克隆用于测试环境并限制生命周期
  • 性能基线:IOPS、时延(读/写)、队列深度,按月采集,扩容与业务上线前必须复测
  • 告警接入:控制器、电源、风扇、电池、盘、链路、卷容量全部接入统一监控
  • 固件与驱动:控制器固件、HBA 驱动、多路径软件版本要在兼容列表内,升级走变更窗口
  • 容量水位:卷使用率 75% 预警、85% 必须处理,避免写满导致业务异常

容易踩的坑

  • 主机只插了一条链路,控制器切换时业务 IO 直接卡死
  • 两条路径插在同一台交换机,交换机重启即双路径同时失效
  • 多路径软件没装或配置错误,出现重复盘符(同一 LUN 看到两块盘)
  • 扩容时只加了存储侧端口,主机侧没重新扫盘
  • 路径告警没接入监控,断了半年没人知道
  • 割接前没做链路演练,真故障时没人敢切

验证与巡检

# 多路径健康
multipath -ll | grep -c 'active ready'      # 应有 2 倍 LUN 数量
dmesg | grep -i -E 'path.*fail|multipath' | tail

# 链路丢包与错误
cat /sys/class/fc_host/host*/statistics/*error* 2>/dev/null | head

# 业务侧时延观察
iostat -x 1 3 | grep -E 'Device|sd'
  • 巡检:每 LUN ≥2 条 active 路径、无 FC 错误计数增长、时延 < 基线 1.5 倍

小结

SAN 运维验收:拔掉一条链路业务不中断、单盘故障能自动热备重建、时延基线在阈值内、告警能到人。三项都能实测,才算运维到位。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。