适用场景
超融合把计算、存储、网络揉在一起,好处是简单,风险是「一起坏」。运维要点:扩容要慢、重建要盯、故障域要分开、容量要留余量。
配置步骤(故障域与节点故障处理)
# 1) 故障域检查清单
# - 三节点是否在同一机柜?(应分在不同机柜)
# - 供电是否来自同一 PDU?(应双路分供)
# - 存储内网是否同一交换机?(应双上行两台交换机)
# 2) 节点故障处理流程
# a. 确认节点状态(失联/宕机)
# b. 确认副本与数据是否健康(是否有降级)
# c. 判断是网络问题还是主机问题(先看交换机与链路)
# d. 恢复节点后观察重建,不要立刻叠加业务
# 3) 演练:模拟断电
# - 断电一台节点,验证:
# 业务不中断、副本自动重建、告警正确
关键参数与建议
- 容量余量:单节点故障后剩余容量要能承载重建,实际可用水位不超 70%
- 故障域:机柜、供电、交换机都要分开,别把三节点塞进一个机柜
- 扩容:一次加一台,等数据均衡完成再加下一台,避免同时重建压力叠加
- 重建监控:重建期间盯时延与业务影响,必要时限速
- 版本一致:集群内节点版本必须一致,升级走滚动流程
- 网络:存储内网独立,万兆起步,链路冗余
- 备份:集群内副本不等于备份,重要数据必须异地或离线备份
- 演练:模拟单节点宕机,验证业务不中断且自动恢复
容易踩的坑
- 三节点同机柜,机柜断电集群整体不可用
- 存储内网同一台交换机,交换机重启即集群脑裂
- 节点失联先重启主机,实际是网络问题导致重复重建
- 副本策略配成 1 副本,节点故障数据直接丢
- 恢复节点后立刻跑大批量任务,重建与业务互相拖累
- 报警没分级,节点故障与磁盘告警混在一起
验证与巡检
# 节点与副本健康(按厂商命令)
# 1) 节点 online、无 offline
# 2) 无降级卷、无 failed 磁盘
# 3) 副本策略符合设计(关键业务 ≥2 副本)
# 演练记录:断电节点、恢复时间、业务验证、重建耗时
- 巡检:故障域分离、副本策略正确、季度断电演练、恢复时间达标
小结
超融合验收:拔掉一台节点的电源,业务不中断、数据不丢、重建在计划时间内完成;扩容一台节点后数据自动均衡。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。