Procédure

Sécuriser un datastore VMware presque plein

Traiter un datastore VMware presque plein sans supprimer de fichiers VM au hasard : inventorier l’espace, snapshots, ISO et logs, libérer de la marge, migrer ou étendre puis consolider proprement.

ThématiqueVMware →
⌚ Environ 6 min de lecture
Voir mes favoris
DomaineVMwareNiveauAvancéDurée30-180 minRisqueÉlevé

Objectif

Réduire rapidement le risque d’arrêt de VM ou d’échec de snapshot sur un datastore VMware presque plein, en identifiant les principaux consommateurs, en libérant de l’espace sans casser les chaînes de disques, puis en migrant ou augmentant la capacité avant consolidation.

Prérequis

  • Accès vCenter
  • Inventaire des VM, snapshots, ISO, templates et jobs de sauvegarde utilisant ce datastore.
  • Un datastore alternatif ou possibilité d’extension du LUN/volume si la capacité doit être augmentée.
  • Fenêtre de changement si des VM doivent être déplacées ou arrêtées.
  • Sauvegarde récente des VM critiques avant toute opération risquée.

Procédure pas à pas

1

Mesurer l’urgence et la tendance

Relevez capacité, espace libre, pourcentage utilisé et vitesse de consommation si vous disposez de métriques. L’alarme vCenter Datastore usage on disk sert à alerter avant saturation ; les seuils peuvent varier selon votre configuration. Identifiez immédiatement les VM en forte écriture, les snapshots récents et les jobs de sauvegarde qui peuvent accélérer la consommation.

Résultat attendu
  • Le niveau de criticité et la cause probable de la croissance sont connus.
2

Lister les consommateurs sans supprimer

Utilisez vCenter et le datastore browser pour identifier les répertoires volumineux, ISO oubliées, anciens bundles de logs, templates ou VM inutilisées. Ne déduisez pas qu’un gros fichier delta est supprimable : il peut appartenir à une chaîne active. Pour chaque élément candidat, rattachez-le à une VM, un snapshot ou un usage avant action.

Résultat attendu
  • Une liste de données supprimables sans risque et de fichiers appartenant aux VM est établie.
3

Contrôler les snapshots et la consolidation

Pour chaque VM du datastore, vérifiez Snapshot Manager et l’alerte Needs Consolidation. Les snapshots anciens peuvent consommer beaucoup d’espace. Si un snapshot doit être supprimé, assurez-vous d’abord que le datastore possède suffisamment de marge pour la consolidation. N’effacez pas les delta VMDK manuellement.

Résultat attendu
  • Les chaînes de snapshots sont identifiées et aucune suppression manuelle n’est planifiée.
4

Libérer rapidement de l’espace non critique

Supprimez ou déplacez en priorité les ISO non utilisées, anciens logs/bundles confirmés inutiles, exports et fichiers temporaires clairement identifiés. Si une VM éteinte ou un template peut être déplacé sans impact, utilisez une migration ou copie gérée. L’objectif initial est de recréer une marge de sécurité, pas d’optimiser parfaitement le stockage.

Résultat attendu
  • Le datastore retrouve une marge suffisante pour permettre les opérations de correction.
5

Migrer des VM vers un datastore plus sain

Si un autre datastore possède suffisamment d’espace, effectuez une Storage vMotion des VM appropriées. Commencez par une VM non critique ou un disque volumineux dont la migration apporte immédiatement de la marge. Vérifiez les politiques de stockage, thin/thick provisioning et compatibilité du datastore cible.

Résultat attendu
  • La consommation du datastore critique baisse sans perte de disponibilité des VM migrées.
6

Étendre la capacité si le stockage le permet

Si la baie ou le backend peut agrandir le LUN/volume, augmentez d’abord la capacité côté stockage puis faites reconnaître et étendre le datastore dans vSphere selon la procédure supportée. Confirmez que l’extension vise le bon périphérique et que tous les hôtes voient la nouvelle taille avant de considérer le risque traité.

Résultat attendu
  • Le datastore affiche la nouvelle capacité sur les hôtes concernés.
7

Consolider les snapshots uniquement avec une marge suffisante

Une fois l’espace sécurisé, supprimez ou consolidez les snapshots identifiés via vCenter. Surveillez la tâche jusqu’à son terme. Broadcom indique qu’un manque d’espace peut faire échouer la consolidation et qu’une consolidation démarrée ne doit pas être annulée arbitrairement. Si l’espace redevient critique, augmentez la capacité plutôt que de supprimer des fichiers de chaîne.

Résultat attendu
  • Les snapshots inutiles sont consolidés sans erreur et la VM reste opérationnelle.
8

Vérifier les VM qui ont subi un out-of-space

Si une VM a été mise en pause, arrêtée ou a affiché No space left on device, contrôlez son état et ses disques après récupération de capacité. Répondez aux questions vSphere uniquement après avoir créé assez de marge. Vérifiez les logs de la VM et l’intégrité applicative, car une interruption d’écriture peut avoir affecté l’application.

Résultat attendu
  • Les VM impactées redémarrent et leurs applications sont validées.
9

Mettre en place des seuils et une capacité préventive

Une fois l’incident résolu, ajustez les alarmes de capacité, la supervision et les règles d’exploitation. Les datastores accueillant des VM à forte croissance ou des snapshots de sauvegarde doivent conserver une marge suffisante. Documentez aussi les seuils d’escalade : avertissement, critique et action obligatoire.

Résultat attendu
  • La croissance future est supervisée avant d’atteindre un niveau dangereux.

Validation

La procédure est validée lorsque :

  • Le datastore dispose de nouveau d’une marge de capacité adaptée à sa charge.
  • Aucun fichier de disque ou snapshot n’a été supprimé manuellement.
  • Les VM et consolidations importantes fonctionnent après la correction.
  • Les alarmes de capacité et le plan d’action préventif sont configurés.

Retour arrière

  • Si une migration de stockage échoue, conserver la VM dans son état actuel et traiter la cause sans supprimer les fichiers source.
  • Si l’extension de datastore ne se présente pas correctement, arrêter la modification et vérifier le LUN/volume côté stockage avant toute autre opération.
  • Ne pas tenter de rollback en recopiant manuellement des fichiers VMDK ou snapshot ; utiliser les mécanismes vSphere ou la sauvegarde.
  • Restaurer une VM depuis une sauvegarde si une chaîne de disques est devenue incohérente et que la réparation supportée échoue.

Dépannage / erreurs fréquentes

  • Datastore atteint 100 % : libérer d’abord des fichiers non liés aux chaînes VM ou augmenter la capacité avant consolidation.
  • Snapshot delete échoue faute d’espace : déplacer une VM, libérer/ajouter de la capacité puis relancer la consolidation supportée.
  • Storage vMotion impossible car une question out-of-space est en attente : recréer de la marge puis traiter l’état de la VM.
  • Espace libre ne remonte pas après suppression : vérifier tâches de consolidation, snapshots cachés/Needs Consolidation et utilisation réelle du datastore.
  • Alarme non déclenchée malgré forte consommation : vérifier que Datastore usage on disk est activée et correctement définie dans vCenter.

Références officielles

♡ 0