Centre Proxmox VE
Diagnostic guidé pour PVE, QEMU, LXC, cluster, Corosync, quorum, Ceph, ZFS, stockage, sauvegarde et réseau.
Le GUI ou un nœud du cluster ne répond plus.
- Vérifier réseau/SSH puis
systemctl --failed. - Contrôler
pveproxy,pvedaemonetpvestatd. - Vérifier espace disque, DNS et certificats PVE.
systemctl status pveproxy pvedaemon pvestatdjournalctl -u pveproxy -n 100 --no-pagerUne VM refuse de démarrer ou reste verrouillée.
- Lire la tâche dans l’interface puis
qm status <VMID>. - Contrôler stockage, configuration et locks avant de forcer quoi que ce soit.
- Vérifier disponibilité RAM/CPU et passthrough éventuel.
qm status 100qm config 100qm unlock 100Un conteneur échoue au démarrage.
- Consulter
pct statuset la configuration. - Contrôler rootfs, stockage et montage.
- Vérifier les logs systemd/LXC avant modification.
pct status 101pct config 101pct start 101 --debugLe cluster perd le quorum ou des nœuds passent en état inconnu.
- Exécuter
pvecm statussur plusieurs nœuds. - Vérifier latence, MTU, multicast/unicast Corosync et résolution des noms.
- Ne jamais forcer les votes sans comprendre le risque de split-brain.
pvecm statuspvecm nodesjournalctl -u corosync -n 150 --no-pagerLes liens cluster deviennent instables ou les nœuds se voient par intermittence.
- Comparer
corosync-cfgtool -ssur chaque nœud. - Tester perte, latence et MTU sur le réseau Corosync.
- Contrôler que les adresses configurées sont stables et dédiées si possible.
corosync-cfgtool -scorosync-quorumtool -sUn stockage PVE passe en unknown/inactive.
- Contrôler
pvesm status. - Tester la connectivité vers NFS/iSCSI/Ceph et les credentials.
- Vérifier montages, services et saturation avant redémarrage.
pvesm statuspvesm scan nfs 192.0.2.10Le thin pool local-lvm approche 100 % ou les VM se figent.
- Contrôler
lvs -a -o +data_percent,metadata_percent. - Identifier snapshots et disques inutiles avant suppression.
- Ne jamais laisser Data% ou Meta% atteindre 100 %.
lvs -a -o +data_percent,metadata_percentpvesm statusCeph signale un état dégradé ou critique.
- Commencer par
ceph -spuisceph health detail. - Identifier OSD down/out, PG degraded, full ratio ou problème MON.
- Éviter les commandes destructives tant que la cause n’est pas identifiée.
ceph -sceph health detailceph osd treeUne sauvegarde VM/LXC échoue ou reste bloquée.
- Lire la tâche vzdump complète.
- Contrôler espace, permissions et disponibilité du stockage/PBS.
- Vérifier snapshots/locks et cohérence guest agent.
vzdump 100 --mode snapshot --compress zstd --storage backupjournalctl -u pvedaemon -n 100 --no-pagerUne migration online/offline échoue.
- Vérifier stockage partagé ou mapping des storages.
- Tester SSH et réseau migration entre nœuds.
- Contrôler CPU type, local resources et passthrough.
qm migrate 100 node2 --onlinepvesm statusPool ZFS DEGRADED ou réplication PVE en erreur.
- Exécuter
zpool status -v. - Contrôler capacité et erreurs physiques avant scrub/remplacement.
- Vérifier snapshots et connectivité SSH pour la réplication.
zpool status -vzfs list -o name,used,avail,refer,mountpointUne VM a une interface mais n’accède plus au réseau.
- Contrôler bridge, VLAN tag et firewall PVE.
- Comparer la configuration de la VM et
/etc/network/interfaces. - Tester depuis l’hôte puis depuis la VM pour isoler la couche fautive.
ip -br linkbridge vlan showcat /etc/network/interfacesPerte réseau après modification bond/VLAN.
- Vérifier mode bond et configuration côté switch.
- Contrôler VLAN aware et tags sur vmbr.
- Valider un changement réseau avec console hors bande disponible.
cat /proc/net/bonding/bond0bridge vlan showUne tâche laisse un lock empêchant d’autres actions.
- Vérifier qu’aucune tâche légitime n’est encore active.
- Identifier la raison du lock dans la config et les tâches.
- Utiliser unlock seulement après validation.
qm config 100 | grep lockqm unlock 100Le passthrough PCI/GPU ne fonctionne pas.
- Vérifier IOMMU dans le BIOS et paramètres kernel.
- Contrôler groupes IOMMU et driver vfio-pci.
- S’assurer que le périphérique n’est pas utilisé par l’hôte.
dmesg | grep -Ei "DMAR|IOMMU"find /sys/kernel/iommu_groups/ -type lapt update retourne des erreurs de dépôt.
- Vérifier version PVE et dépôt configuré.
- Ne pas mélanger dépôts incompatibles Debian/PVE.
- Contrôler DNS, heure, certificats et clé de dépôt.
pveversion -vapt updatepveversion -v
pvecm status
pvecm nodes
qm list
qm config 100
pct list
pvesm status
lvs -a -o +data_percent,metadata_percent
zpool status -v
ceph -s
ceph health detail
bridge vlan show
systemctl --failed
journalctl -u corosync -n 150 --no-pager
pvesh get /cluster/tasks --limit 20
Projection de capacité stockage
Estimer le taux d’occupation après ajout de données. Utiliser les mêmes unités dans les trois champs.
Quorum avant tout
Sur un cluster, vérifier quorum et Corosync avant d’agir sur les VM.
Stockage avant VM
Une VM « cassée » est souvent la conséquence d’un stockage indisponible ou plein.
Locks avec prudence
Ne retirer un lock que si la tâche correspondante est réellement terminée.
Ceph : health detail
Ne pas corriger un HEALTH_ERR à l’aveugle ; lire le détail et l’état des OSD/PG.
Console hors bande
Prévoir iDRAC/iLO/IPMI avant toute modification réseau d’un nœud distant.
Sauvegarde testée
Une sauvegarde PVE/PBS n’est utile que si la restauration a déjà été validée.