适用场景
存储出问题的代价通常比服务器大:一台服务器挂了业务还能切,存储挂了所有虚机和数据库一起躺。SAN 运维的核心就三件事:路径别断、盘别同时坏、性能基线心里有数。
配置步骤(多路径与链路冗余)
# 1) 主机侧多路径状态(Linux + DM-Multipath)
multipath -ll
# 关注:每条 LUN 是否 2 条以上 path,状态是否为 active ready
# 2) 路径故障演练前先确认
cat /etc/multipath.conf | grep -A5 'defaults'
lsblk -S # HBA 与盘符映射
# 3) 交换机侧核对:两条路径是否分别在不同交换机
# display interface brief | include <上行口>
# 4) 单链路断开演练(低峰执行,先备份业务)
# 断开 A 面交换机对应端口,观察:
# - multipath -ll 中 path 变为 failed
# - 业务 IO 不中断(时延允许短时上升)
# - 监控产生链路告警而不是业务告警
关键参数与建议
- 双控双路径:主机侧多路径(MPIO/multipath)必须启用,两条路径分别走不同交换机
- RAID 策略:业务盘优先 RAID10 或 RAID6 + 热备盘,热备盘要定期检查是否真的在被使用
- LUN 映射:命名与用途要能对应到业务(禁止 LUN01/02 这种命名),映射变更要留记录
- 快照与克隆:快照不是备份,只用于短时回滚;克隆用于测试环境并限制生命周期
- 性能基线:IOPS、时延(读/写)、队列深度,按月采集,扩容与业务上线前必须复测
- 告警接入:控制器、电源、风扇、电池、盘、链路、卷容量全部接入统一监控
- 固件与驱动:控制器固件、HBA 驱动、多路径软件版本要在兼容列表内,升级走变更窗口
- 容量水位:卷使用率 75% 预警、85% 必须处理,避免写满导致业务异常
容易踩的坑
- 主机只插了一条链路,控制器切换时业务 IO 直接卡死
- 两条路径插在同一台交换机,交换机重启即双路径同时失效
- 多路径软件没装或配置错误,出现重复盘符(同一 LUN 看到两块盘)
- 扩容时只加了存储侧端口,主机侧没重新扫盘
- 路径告警没接入监控,断了半年没人知道
- 割接前没做链路演练,真故障时没人敢切
验证与巡检
# 多路径健康
multipath -ll | grep -c 'active ready' # 应有 2 倍 LUN 数量
dmesg | grep -i -E 'path.*fail|multipath' | tail
# 链路丢包与错误
cat /sys/class/fc_host/host*/statistics/*error* 2>/dev/null | head
# 业务侧时延观察
iostat -x 1 3 | grep -E 'Device|sd'
- 巡检:每 LUN ≥2 条 active 路径、无 FC 错误计数增长、时延 < 基线 1.5 倍
小结
SAN 运维验收:拔掉一条链路业务不中断、单盘故障能自动热备重建、时延基线在阈值内、告警能到人。三项都能实测,才算运维到位。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。