Un singolo nodo Proxmox è fantastico per ridurre i costi di hardware, ma rimane un single point of failure. Quando l'infrastruttura IT diventa critica per il business, è il momento di pensare al cluster con alta disponibilità. Ecco come si fa.

Requisiti minimi per un cluster HA

Per un cluster Proxmox con HA funzionante servono:

Il fencing è non negoziabile: senza un meccanismo di fencing affidabile, un cluster HA può causare split-brain e corruzione dei dati. Non saltare questo passaggio.

Creazione del cluster

Sul primo nodo (pve1):

pvecm create nome-cluster --link0 192.168.100.1

Aggiungi gli altri nodi (da pve2, pve3):

pvecm add 192.168.100.1 --link0 192.168.100.2

Verifica lo stato del cluster:

pvecm status
pvecm nodes

Configurazione dello storage condiviso

Opzione 1: Ceph integrato (consigliato per nuove installazioni)

Ceph è la soluzione storage distribuita integrata in Proxmox. Ogni nodo contribuisce con i propri dischi al pool condiviso. Ridondanza nativa, nessun NAS esterno necessario.

# Sul primo nodo
pveceph init --network 192.168.101.0/24
pveceph createmon
pveceph createosd /dev/sdb

# Ripeti createmon e createosd su ogni nodo
# Crea il pool
pveceph createpool vm-storage --size 3 --min_size 2

Opzione 2: NFS/iSCSI esterno

Se hai già un NAS (Synology, TrueNAS, NetApp), configura uno storage NFS o iSCSI condiviso tra i nodi. Più semplice di Ceph, ma il NAS diventa un single point of failure da proteggere separatamente.

Configurazione HA per le VM

Una volta che il cluster è operativo con storage condiviso, abilitare HA su una VM è semplice da GUI: seleziona la VM → More → Manage HA. Da command line:

ha-manager add vm:100 --state started --group produzione
ha-manager set vm:100 --max_restart 3 --max_relocate 1

Gruppi HA e politiche di failover

I gruppi HA definiscono su quali nodi può girare una VM e con quale priorità:

ha-manager groupadd produzione --nodes pve1:2,pve2:1,pve3:1 --restricted 1

Con --restricted, la VM non viene mai migrata su nodi non nel gruppo. Utile per rispettare vincoli di licenza software o di posizione geografica.

Test del failover

Prima di andare in produzione, simula un failure:

# Simula crash di un nodo
systemctl stop pve-cluster corosync

# Oppure usa il fencing manuale
fence_pve -a [ip-pve] -l root -p [password] -n [vmid] -o off

Verifica che le VM in HA ripartano automaticamente entro i tempi configurati (di default entro 2 minuti dal fence del nodo).

Monitoraggio del cluster

Tieni d'occhio questi indicatori:

Posso aiutarti con la tua infrastruttura?

Che tu abbia un progetto da zero o un problema da risolvere, scrivimi o prenota una call gratuita di 30 minuti.

Invia un messaggio → Prenota una call gratuita ↗