Centre VMware / Virtualisation
Diagnostic guidé et commandes terrain pour ESXi, vCenter, VM, snapshots, datastore, stockage partagé, réseau virtuel, HA, DRS et sauvegarde.
vim-cmd vmsvc/getallvms
esxcli vm process list
esxcli storage filesystem list
vim-cmd vmsvc/power.getstate <VMID>
vim-cmd vmsvc/power.on <VMID>
vim-cmd vmsvc/power.shutdown <VMID>
vim-cmd vmsvc/power.off <VMID>
vim-cmd vmsvc/snapshot.get <VMID>
vim-cmd vmsvc/snapshot.removeall <VMID>
esxcli storage core device list
esxcli storage core path list
esxcli storage nmp device list
esxcli iscsi adapter list
vmkfstools -D /vmfs/volumes/<DATASTORE>/<VM>/<DISQUE>.vmdk
esxcli network nic list
esxcli network ip interface list
esxcli network ip interface ipv4 get
esxcli network ip route ipv4 list
esxcli network vswitch standard list
vmkping -I vmk0 <IP_CIBLE>
/etc/init.d/hostd status
/etc/init.d/vpxa status
services.sh restart
/etc/init.d/fdm status
tail -n 100 /var/log/fdm.log
tail -n 100 /vmfs/volumes/<DATASTORE>/<VM>/vmware.log
tail -n 100 /var/log/vmkernel.log
tail -n 100 /var/log/hostd.log
Connect-VIServer -Server <VCENTER>
Get-VM
Get-VM | Get-Snapshot
Get-Datastore | Select Name,CapacityGB,FreeSpaceGB
Get-VMHost
Get-VM | Select Name,@{N='ToolsStatus';E={$_.ExtensionData.Guest.ToolsStatus}}
Get-VM | Get-NetworkAdapter | Select Parent,Name,NetworkName,MacAddress
Calculateur de capacité datastore
Estimez rapidement l’espace restant après ajout ou croissance de VM.
Snapshot ≠ sauvegarde
Un snapshot est temporaire et dépend du datastore et de la VM d’origine.
Éviter les snapshots longs
Les deltas peuvent grossir et compliquer consolidation, sauvegarde et performances.
Ne jamais supprimer un VMDK à l’aveugle
Identifiez la chaîne de disques et les descriptors avant toute suppression.
Conserver de la marge
Un datastore presque plein peut empêcher snapshot, consolidation ou démarrage de VM.
Tester le vmkernel
Pour vMotion, iSCSI ou management, testez depuis le vmkernel réellement concerné.
Documenter les paths SAN
Conservez HBA, WWPN, zoning, LUN et politiques multipath dans la documentation d’infrastructure.
Mission du centre
8 playbooksDiagnostiquer ESXi/vCenter en séparant capacité hôte, datastore, état VM, snapshots, réseau, VMware Tools, vMotion et HA avant toute action sur l’infrastructure.
Triage rapide
- Vérifier alarmes vCenter/ESXi et événement déclencheur.
- Contrôler santé hôte, CPU/RAM et datastores.
- Identifier si une VM, un datastore ou tout le cluster est touché.
- Vérifier snapshots/consolidation avant opérations de stockage.
- Conserver tâches/événements et timestamps avant restart agent/hôte.
Arbre de décision
Commencer par état VM, fichiers, snapshot, Tools et réseau virtuel.
Prioriser capacité, latence et connectivité stockage.
Contrôler management, ressources, agents et matériel.
Vérifier vCenter, HA heartbeat, admission control et réseau management.
Playbooks d’intervention
Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.
01VM ne démarre pasModification contrôlée
Power On échoue avec erreur de ressource, fichier verrouillé ou configuration.
Vérifications
- Lire tâche/événement exact dans vCenter.
- Vérifier datastore libre, host resources et fichiers VM.
- Contrôler verrou ou snapshot/consolidation.
Commandes / preuves
vim-cmd vmsvc/getallvmsvim-cmd vmsvc/power.getstate <vmid>esxcli storage filesystem listRésultat attendu
La VM dispose de ressources, fichiers accessibles et aucun verrou illégitime.
Actions correctives
- Corriger ressource/datastore/lock identifié avant re-register ou autre action lourde.
- Éviter supprimer manuellement des fichiers de snapshot.
Escalader si
Fichiers VM corrompus, verrou multi-hôte ou stockage instable.
02Datastore presque pleinIntrusif / escalade
Alarme capacité, snapshots impossibles ou VM suspendues par manque d’espace.
Vérifications
- Mesurer capacité/libre et croissance récente.
- Identifier snapshots, ISO et fichiers orphelins sans supprimer à l’aveugle.
- Vérifier thin provisioning côté baie.
Commandes / preuves
esxcli storage filesystem listdu -h /vmfs/volumes/<datastore>/<vm> 2>/dev/nullvim-cmd vmsvc/snapshot.get <vmid>Résultat attendu
Une source de croissance est identifiée et une marge de sécurité est rétablie.
Actions correctives
- Consolider/supprimer snapshots via vSphere avec espace suffisant.
- Étendre ou migrer si capacité légitime.
Escalader si
Datastore critique >95 %, baie également pleine ou consolidation nécessite forte capacité temporaire.
03Snapshot / consolidation requiseIntrusif / escalade
Consolidation needed, snapshot très ancien ou suppression échoue.
Vérifications
- Lister snapshots et âge/taille.
- Vérifier espace datastore suffisant.
- Contrôler tâches backup pouvant maintenir snapshot.
Commandes / preuves
vim-cmd vmsvc/snapshot.get <vmid>esxcli storage filesystem listls -lh /vmfs/volumes/<datastore>/<vm>/Résultat attendu
Chaîne de snapshot connue, datastore avec marge et aucune tâche concurrente.
Actions correctives
- Lancer consolidation depuis vSphere dans une fenêtre surveillée.
- Stopper la cause de snapshots récurrents côté backup.
Escalader si
Chaîne incohérente, delta énorme ou consolidation échoue avec erreur disque/lock.
04VM sans réseauLecture / sans risque
VM démarrée mais pas d’accès réseau, gateway ou services.
Vérifications
- Vérifier vNIC connectée et bon port group.
- Contrôler VLAN du port group/vSwitch/dvSwitch.
- Comparer autre VM sur même port group.
Commandes / preuves
esxcli network vm listesxcli network nic listesxcli network vswitch standard listRésultat attendu
vNIC est connectée au bon réseau et uplink physique est up.
Actions correctives
- Corriger port group/VLAN/uplink selon la couche fautive.
- Ne pas modifier plusieurs VLAN d’un trunk sans impact analysis.
Escalader si
dvSwitch/vCenter incohérent, teaming complexe ou panne réseau physique partagée.
05Hôte ESXi surchargéLecture / sans risque
VM lentes, ready time élevé, mémoire balloon/swap ou datastore latency.
Vérifications
- Distinguer CPU contention, memory pressure et storage latency.
- Identifier VM consommatrices.
- Comparer autres hôtes du cluster.
Commandes / preuves
esxtopesxcli hardware memory getesxcli system stats uptime getRésultat attendu
La ressource limitante est identifiée et non simplement une moyenne globale.
Actions correctives
- Rééquilibrer/migrer charge ou corriger VM responsable.
- Éviter de surallouer davantage pour masquer contention.
Escalader si
Contention cluster-wide, stockage partagé lent ou capacity planning nécessaire.
06VMware Tools absent ou obsolèteModification contrôlée
Guest status inconnu, shutdown propre indisponible ou drivers réseau/storage anciens.
Vérifications
- Lire état Tools dans vCenter.
- Vérifier version OS et compatibilité.
- Prévoir reboot si drivers nécessitent.
Commandes / preuves
vim-cmd vmsvc/get.guest <vmid>vmware-toolbox-cmd -vsystemctl status open-vm-toolsRésultat attendu
Tools tourne et vCenter reçoit heartbeat/guest info.
Actions correctives
- Mettre à jour via méthode supportée pour l’OS.
- Tester snapshot backup après mise à jour si dépendance VSS/quiescing.
Escalader si
OS legacy, driver critique ou mise à jour Tools provoque régression.
07vMotion échoueLecture / sans risque
Migration live échoue au précheck, réseau ou stockage.
Vérifications
- Lire erreur de compatibilité/precheck.
- Vérifier vmkernel vMotion, MTU et connectivité.
- Contrôler accès partagé au datastore et EVC/CPU.
Commandes / preuves
esxcli network ip interface listvmkping -I vmk<Vmotion> <peer-ip>esxcli network ip route ipv4 listRésultat attendu
Les vmkernel se joignent avec le MTU prévu et les hôtes sont compatibles.
Actions correctives
- Corriger réseau vmkernel ou compatibilité ciblée.
- Retester une VM non critique avant migration massive.
Escalader si
vDS, NSX, EVC ou stockage multi-path complexe.
08HA / hôte isoléIntrusif / escalade
Hôte déconnecté, isolation response ou VM redémarrées par HA.
Vérifications
- Vérifier réseau management et gateways isolation.
- Contrôler agents HA et accès datastores heartbeat.
- Lire événements cluster avant toute reconnexion.
Commandes / preuves
vmkping <management-gateway>esxcli network ip interface list/etc/init.d/hostd statusRésultat attendu
Hôte reste joignable management et HA voit suffisamment de heartbeat.
Actions correctives
- Corriger réseau management avant reconfiguration HA.
- Valider capacité cluster avant toute mise en maintenance.
Escalader si
Split-brain réseau/storage, plusieurs hôtes isolés ou risque de double démarrage VM.
Checklist de fin d’intervention
- Vérifier alarmes vCenter revenues au vert.
- Contrôler datastore, host et VM après correction.
- Retester réseau/Tools/application depuis la VM concernée.
- Documenter snapshot, migration ou changement d’infrastructure.
- Surveiller tâches backup/HA après intervention.