适用场景

开源虚拟化省授权费,但把复杂度留给了运维:网络桥接、存储池、集群仲裁、备份策略都要自己定。做得好比商业方案更灵活,做得差就是「三台单机拼出来的假集群」。

配置步骤(Proxmox 集群与备份)

# 1) 集群状态(三节点示例)
pvecm status
pvecm nodes

# 2) 存储与虚机
pvesm status
qm list

# 3) 备份任务(vzdump)
# /etc/pve/jobs.cfg 示例:每日 02:00 全量到备份存储,保留 7 份
vzdump 100 --storage backup-nfs --mode snapshot --compress zstd --mailnotification failure

# 4) 恢复演练(恢复到隔离虚机 ID)
qmrestore /mnt/pve/backup-nfs/dump/vzdump-qemu-100-2026_09_20-02_00_00.vma.zst 900 --storage local-lvm

# 5) 集群注意
#  - 2 节点集群必须配 qdisk 仲裁,否则脑裂
#  - 升级用 pveupdate/pveupgrade,逐节点做

关键参数与建议

  • 网络:管理网与业务网分离,桥接用 bond 双上行,禁用不必要的 STP 干扰
  • 存储:虚机盘优先本地 SSD + 定期备份,集中存储要考虑 IO 争抢
  • 集群:至少 3 节点保证仲裁(2 节点必须配仲裁设备或 qdisk)
  • 备份:内置 vzdump/快照备份,按「每日增量 + 每周全量」组合
  • 隔离:不要把所有业务放在一台宿主机,关注单点
  • 监控:宿主机 CPU/内存/存储/网卡与虚机状态全部接入
  • 升级:先在测试节点升级并跑一周,再滚动升级生产节点
  • 文档:每个虚机的规格、用途、负责人、备份策略成表

容易踩的坑

  • 两节点集群没配仲裁,网络抖动后两边都以为对方挂了
  • 备份存储与虚机存储是同一块盘,盘坏全丢
  • 备份只保留 1 份,误删虚机后没有历史版本
  • 快照模式备份在 LVM-thin 上没留空间,备份失败
  • 集群跨机房部署,延迟导致仲裁频繁抖动
  • 从不做恢复演练,真恢复时发现备份损坏

验证与巡检

pvecm status | grep -E 'Quorate|Nodes'
pvesm status

# 备份产物核对
ls -l /mnt/pve/backup-nfs/dump/ | tail

# 恢复演练记录:虚机 ID、耗时、业务验证结果
  • 巡检:集群 Quorate、备份文件存在且大小正常、恢复演练记录、升级计划已排期

小结

KVM/Proxmox 运维验收:任意一台宿主机整机故障,业务能在计划时间内恢复;集群仲裁正常;备份能恢复到隔离环境。

> 说明:文中命令为通用写法,不同型号/版本可能略有差异,落地前请对照设备实际版本的官方文档;带外管理与安全设备变更建议先在测试设备验证。