Un singolo nodo Proxmox è fantastico per ridurre i costi di hardware, ma rimane un single point of failure. Quando l'infrastruttura IT diventa critica per il business, è il momento di pensare al cluster con alta disponibilità. Ecco come si fa.
Requisiti minimi per un cluster HA
Per un cluster Proxmox con HA funzionante servono:
- Minimo 3 nodi (per avere quorum stabile; con 2 nodi il quorum è fragile)
- Rete di cluster dedicata — non usare la stessa interfaccia del traffico delle VM
- Storage condiviso per le VM in HA: Ceph, NFS, iSCSI, o Proxmox con replica
- Fencing device — meccanismo per isolare un nodo guasto (IPMI/iDRAC/iLO, PDU controllabile, o storage fencing)
Il fencing è non negoziabile: senza un meccanismo di fencing affidabile, un cluster HA può causare split-brain e corruzione dei dati. Non saltare questo passaggio.
Creazione del cluster
Sul primo nodo (pve1):
pvecm create nome-cluster --link0 192.168.100.1
Aggiungi gli altri nodi (da pve2, pve3):
pvecm add 192.168.100.1 --link0 192.168.100.2
Verifica lo stato del cluster:
pvecm status
pvecm nodes
Configurazione dello storage condiviso
Opzione 1: Ceph integrato (consigliato per nuove installazioni)
Ceph è la soluzione storage distribuita integrata in Proxmox. Ogni nodo contribuisce con i propri dischi al pool condiviso. Ridondanza nativa, nessun NAS esterno necessario.
# Sul primo nodo
pveceph init --network 192.168.101.0/24
pveceph createmon
pveceph createosd /dev/sdb
# Ripeti createmon e createosd su ogni nodo
# Crea il pool
pveceph createpool vm-storage --size 3 --min_size 2
Opzione 2: NFS/iSCSI esterno
Se hai già un NAS (Synology, TrueNAS, NetApp), configura uno storage NFS o iSCSI condiviso tra i nodi. Più semplice di Ceph, ma il NAS diventa un single point of failure da proteggere separatamente.
Configurazione HA per le VM
Una volta che il cluster è operativo con storage condiviso, abilitare HA su una VM è semplice da GUI: seleziona la VM → More → Manage HA. Da command line:
ha-manager add vm:100 --state started --group produzione
ha-manager set vm:100 --max_restart 3 --max_relocate 1
Gruppi HA e politiche di failover
I gruppi HA definiscono su quali nodi può girare una VM e con quale priorità:
ha-manager groupadd produzione --nodes pve1:2,pve2:1,pve3:1 --restricted 1
Con --restricted, la VM non viene mai migrata su nodi non nel gruppo. Utile per rispettare vincoli di licenza software o di posizione geografica.
Test del failover
Prima di andare in produzione, simula un failure:
# Simula crash di un nodo
systemctl stop pve-cluster corosync
# Oppure usa il fencing manuale
fence_pve -a [ip-pve] -l root -p [password] -n [vmid] -o off
Verifica che le VM in HA ripartano automaticamente entro i tempi configurati (di default entro 2 minuti dal fence del nodo).
Monitoraggio del cluster
Tieni d'occhio questi indicatori:
- Stato del quorum (
pvecm status) - Latenza della rete di cluster (deve essere <5ms tra i nodi)
- Stato degli OSD Ceph se applicabile (
ceph status) - Log di corosync per messaggi di timeout
Posso aiutarti con la tua infrastruttura?
Che tu abbia un progetto da zero o un problema da risolvere, scrivimi o prenota una call gratuita di 30 minuti.