适用场景
RAID 配错往往在半年后才暴露:坏一块盘没有热备自动顶上去、阵列降级没人发现,直到第二块盘也坏了才发现数据已经取不回来。开局配好并纳入巡检是关键。
配置步骤(通用 LSI(storcli64))
# 查看控制器与阵列
storcli64 /c0 show
storcli64 /c0 /vall show
storcli64 /c0 /eall /sall show | grep -i fail
# 建 RAID5(示例:4 块盘)
storcli64 /c0 add vd type=raid5 drives=252:0-3
# 加一块全局热备
storcli64 /c0 /e252 /s4 add hotsparedrive
# 定位坏盘槽位(点灯)
storcli64 /c0 /e252 /s2 locate start
关键参数与建议
- 系统盘做 RAID1(或 RAID10),数据盘按业务定 RAID5/6/10,别为了容量把数据库放 RAID5
- 每类阵列至少配 1 块全局热备(RAID5/6 建议 1~2 块),热备盘容量不能小于阵列成员盘
- 建阵列时确认条带(stripe)与读写策略,数据库类业务优先写回策略 + 电池/超级电容在位
- 把 RAID 卡管理工具(storcli/perccli/arcconf)纳入运维包,别等坏了才找工具
- 坏盘更换必须等阵列重建完成再动第二块盘,且按槽位顺序记录
容易踩的坑
- 用错盘:把 SSD 和 HDD 混在同一个阵列里,容量按最小盘算,性能还被最慢的拖住
- 忘记加热备:单盘故障后阵列只处于降级状态,第二块盘一坏就全丢
- 换盘前没记录槽位,热插拔插错槽导致阵列更乱
验证与巡检
storcli64 /c0 /vall show | grep -i degrad
storcli64 /c0 /eall /sall show | grep -iE 'fail|rebuild'
- 巡检:阵列 Optimal、无降级、热备在位、BBU/超级电容状态 OK
小结
RAID 是"容错"不是"备份"。做完阵列仍要按业务做备份与恢复演练,坏了盘能重建、删了库能恢复,才叫双保险。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。