适用场景
集群能跑起来只是开始。生产环境的重点是"可持续":节点怎么下线维护、etcd 怎么备份、资源怎么配额、证书怎么续。
配置步骤(证书与版本管理)
# 查看证书到期
kubeadm certs check-expiration
# 续期
kubeadm certs renew all
# 版本升级(先控制面后节点,逐节点 drain)
关键参数与建议
- 节点维护:先 cordon 再 drain,PodDisruptionBudget 保证可用性
- etcd 备份:定期快照 + 恢复演练(etcd 挂了集群就没了)
- 配额与限制:命名空间级 ResourceQuota + LimitRange,防止单应用吃满
- 扩缩容:HPA 按 CPU/自定义指标,配合 PDB 与节点容量
- 证书与版本:kubelet/etcd 证书到期时间纳入监控,升级走官方流程
容易踩的坑
- 证书到期未监控,集群突然不可用
- 大版本跨版本升级,未按官方顺序
- 升级前不备份 etcd,出问题无法回退
验证与巡检
kubeadm certs check-expiration
kubectl version
- 巡检:证书到期 >60 天、升级记录与回滚预案
小结
集群运维的三个"必须演练":etcd 恢复、节点下线、证书续期。三件事都演练过,才算能兜住生产。
> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。