适用场景
超融合把计算、存储、网络揉在一起,好处是简单,风险是「一起坏」。运维要点:扩容要慢、重建要盯、故障域要分开、容量要留余量。
配置步骤(扩容与数据重建)
# 1) 扩容前检查
# - 现有集群健康:无降级、无重建中的任务
# - 剩余容量能否承载重建(单节点故障场景)
# - 新节点固件/版本与现有节点一致
# 2) 检查集群健康(以常见命令为例)
# 集群状态、数据均衡状态、重建任务
# 3) 加入节点
# - 按厂商流程添加节点并纳入集群
# - 观察数据均衡进度与时延
# 4) 结束时确认
# - 集群回到健康状态
# - 容量与副本策略符合预期
# - 记录扩容前后的容量与性能数据
关键参数与建议
- 容量余量:单节点故障后剩余容量要能承载重建,实际可用水位不超 70%
- 故障域:机柜、供电、交换机都要分开,别把三节点塞进一个机柜
- 扩容:一次加一台,等数据均衡完成再加下一台,避免同时重建压力叠加
- 重建监控:重建期间盯时延与业务影响,必要时限速
- 版本一致:集群内节点版本必须一致,升级走滚动流程
- 网络:存储内网独立,万兆起步,链路冗余
- 备份:集群内副本不等于备份,重要数据必须异地或离线备份
- 演练:模拟单节点宕机,验证业务不中断且自动恢复
容易踩的坑
- 余量不足就扩容,同时坏一台节点变成数据丢失
- 一次加三台节点,重建压力叠加把业务拖垮
- 新节点固件版本不一致,出现兼容性告警
- 扩容期间跑备份或大表变更,IO 争抢严重
- 均衡没做完就急着上业务,负载偏斜
- 扩容后没更新容量台账与告警阈值
验证与巡检
# 集群健康与均衡状态(按厂商命令)
# 1) 集群状态:healthy
# 2) 数据均衡:balanced
# 3) 无 failed 磁盘与降级卷
# 时延与吞吐对比(扩容前后)
# 记录 P95 时延与 IOPS 基线
- 巡检:集群健康、均衡完成、容量余量 ≥ 单节点故障所需、性能基线无退化
小结
超融合验收:拔掉一台节点的电源,业务不中断、数据不丢、重建在计划时间内完成;扩容一台节点后数据自动均衡。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。