Boîte à Outils Informatique

Centre Sauvegarde & PRA

Sauvegarde / PRA

Centre Sauvegarde & PRA

Diagnostic sauvegarde, restauration, immutabilité, réplication, RPO/RTO et capacité.

Windows/VSSWriters VSS
vssadmin list writers
Windows/VSSProviders VSS
vssadmin list providers
Windows/VSSShadow storage
vssadmin list shadowstorage
WindowsVolumes
Get-Volume
WindowsDisques
Get-PhysicalDisk
RéseauStatistiques réseau
Get-NetAdapterStatistics
VMwareSnapshots
Get-VM | Get-Snapshot
VMwareCapacité datastores
Get-Datastore | Select Name,CapacityGB,FreeSpaceGB
LinuxEspace disque
df -h
LinuxTaille répertoire
du -sh <CHEMIN>
DiagnosticHash fichier
Get-FileHash <FICHIER>
DiagnosticTest chemin
Test-Path <CHEMIN_BACKUP>

Calcul RPO / RTO

Estimation capacité

Principe : une sauvegarde n’est validée que lorsqu’une restauration a été testée avec succès.
Dépannage terrain

Mission du centre

8 playbooks

Diagnostiquer une sauvegarde en protégeant d’abord les chaînes de restauration : job, source, snapshot

Triage rapide

  • Identifier dernier point de restauration réellement réussi.
  • Lire code d’erreur du job et étape exacte en échec.
  • Vérifier espace et santé repository avant relance.
  • Sur Windows, vérifier VSS writers/providers si snapshot échoue.
  • Ne jamais purger manuellement une chaîne sans comprendre la rétention.

Arbre de décision

Snapshot/VSS échoue→

Traiter writer/provider/espace avant le moteur de sauvegarde.

Job transfère puis échoue→

Inspecter repository, réseau, quota et chaîne.

Job vert mais restauration douteuse→

Faire un test de restauration isolé : succès du job ≠ restauration validée.

RPO dépassé→

Mesurer gap, sécuriser un nouveau point puis analyser la cause.

Playbooks d’intervention

Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.

01Job de sauvegarde en échecLecture / sans risque
Symptôme

Job passe en Failed/Warning ou n’atteint pas son dernier point.

Vérifications

  • Lire première erreur causale et non seulement la dernière ligne.
  • Vérifier source joignable et credentials.
  • Contrôler repository, quota et réseau.

Commandes / preuves

Get-Service VSSGet-Volume | Sort-Object SizeRemainingTest-NetConnection <repository> -Port <port>

Résultat attendu

L’étape fautive est identifiée : source, snapshot, transfert ou repository.

Actions correctives

  • Corriger la première cause puis relancer un job contrôlé.
  • Conserver logs et job ID avant nettoyage.

Escalader si

Chaîne de restauration critique, corruption suspectée ou plusieurs jobs échouent simultanément.

02VSS writer en erreurModification contrôlée
Symptôme

Snapshot Windows échoue avec writer Failed/Retryable error.

Vérifications

  • Lister tous les writers et noter le writer fautif.
  • Contrôler service associé et événements VSS/SPP.
  • Vérifier shadow storage et espace libre.

Commandes / preuves

vssadmin list writersvssadmin list providersvssadmin list shadowstorageGet-WinEvent -LogName Application -MaxEvents 100 | ? ProviderName -match "VSS|SPP"

Résultat attendu

Tous les writers critiques sont Stable / No error avant nouvelle sauvegarde.

Actions correctives

  • Redémarrer uniquement le service lié si procédure et impact maîtrisés.
  • Éviter reboot aveugle avant d’avoir identifié le writer.

Escalader si

Writer applicatif base de données critique, erreurs récurrentes ou provider tiers.

03Repository presque pleinIntrusif / escalade
Symptôme

Sauvegardes échouent faute d’espace ou rétention ne libère plus assez.

Vérifications

  • Mesurer capacité, croissance et marge nécessaire au prochain job.
  • Comprendre chaîne full/incremental et rétention.
  • Vérifier snapshots storage/object-lock qui empêchent purge.

Commandes / preuves

Get-Volume | Sort-Object SizeRemainingGet-ChildItem <repo> -Directory | Sort-Object LastWriteTimefsutil volume diskfree <drive>

Résultat attendu

Une capacité suffisante existe pour terminer job + merge/rétention sans casser la chaîne.

Actions correctives

  • Étendre repository ou réduire rétention via le logiciel de sauvegarde.
  • Ne jamais supprimer directement des fichiers de chaîne.

Escalader si

Espace critique immédiat, immutabilité empêche purge ou chaîne dépend de fichiers anciens.

04Point de restauration attendu absentLecture / sans risque
Symptôme

Date/heure nécessaire n’apparaît pas dans la console ou le catalogue.

Vérifications

  • Comparer planning, historique job et rétention.
  • Vérifier si job était disabled, skipped ou failed.
  • Contrôler copy job/offsite si seconde copie attendue.

Commandes / preuves

Get-DateGet-ScheduledTask | ? TaskName -match "backup"Get-WinEvent -LogName System -MaxEvents 100

Résultat attendu

Chaque intervalle RPO attendu correspond à un point ou à un échec documenté.

Actions correctives

  • Sécuriser un nouveau point complet si le gap est encore ouvert.
  • Corriger planification/monitoring qui a laissé passer le manque.

Escalader si

RPO contractuel dépassé, perte de points due à corruption ou besoin métier dans la fenêtre manquante.

05Restauration échoueIntrusif / escalade
Symptôme

Point visible mais restauration fichier/VM/base échoue ou produit une donnée inutilisable.

Vérifications

  • Tester un autre point et une cible isolée.
  • Lire erreur de lecture, checksum, permission ou espace.
  • Vérifier dépendances applicatives après restauration.

Commandes / preuves

Get-FileHash <restored-file>Get-VolumeTest-Path <restore-target>

Résultat attendu

La restauration produit des données lisibles et validables sans altérer la production.

Actions correctives

  • Toujours valider en zone isolée avant overwrite de production.
  • Tester plusieurs points pour délimiter une corruption éventuelle.

Escalader si

Plusieurs points sont illisibles, base métier critique ou overwrite irréversible envisagé.

06RPO dépasséIntrusif / escalade
Symptôme

Dernier backup valide est plus ancien que l’objectif métier.

Vérifications

  • Calculer âge exact du dernier point valide.
  • Identifier données modifiées depuis ce point.
  • Vérifier si une autre copie ou réplication couvre le gap.

Commandes / preuves

Get-DateGet-Item <last-backup> | Select LastWriteTimeGet-Volume

Résultat attendu

Le gap de protection est quantifié et une action immédiate permet de réduire le risque.

Actions correctives

  • Déclencher un point sécurisé dès que la source/repository est sain.
  • Informer selon procédure si SLA/RPO est franchi.

Escalader si

RPO métier dépassé sur système critique ou aucune copie secondaire disponible.

07Suspicion ransomware — protéger les sauvegardesIntrusif / escalade
Symptôme

Chiffrement, suppression massive ou compte compromis menace aussi repository/console.

Vérifications

  • Vérifier immutabilité/offline copy sans monter les sauvegardes inutilement.
  • Identifier comptes ayant accès au repository et console.
  • Geler suppressions/rétention automatiques si procédure le permet.

Commandes / preuves

Get-SmbSessionGet-SmbShareAccess -Name <share>Get-LocalGroupMember Administrators

Résultat attendu

Au moins une copie saine, isolée et non modifiable est préservée.

Actions correctives

  • Isoler les chemins de backup de l’incident avant restauration.
  • Changer credentials backup depuis un poste sain selon plan de réponse.

Escalader si

Repository chiffré, immutabilité douteuse ou attaque active sur infrastructure de sauvegarde.

08Test PRA / restauration de validationModification contrôlée
Symptôme

Les backups sont verts mais aucune restauration récente n’a prouvé le PRA.

Vérifications

  • Choisir charge représentative et environnement isolé.
  • Définir RTO/RPO et critères de succès avant le test.
  • Tester identité, réseau, application et cohérence des données.

Commandes / preuves

Get-DateTest-NetConnection <restored-service> -Port <port>Get-FileHash <reference-file>

Résultat attendu

Le service restauré démarre dans le RTO et les données correspondent au point attendu.

Actions correctives

  • Documenter écarts de temps, dépendances et étapes manuelles.
  • Mettre à jour PRA avec les enseignements du test.

Escalader si

RTO/RPO non tenus ou restauration dépend de connaissances non documentées.

Checklist de fin d’intervention

  • Confirmer un nouveau point valide après correction.
  • Vérifier repository, rétention et seconde copie.
  • Effectuer au moins un contrôle de restauration si pertinent.
  • Documenter RPO réel et incident du job.
  • S’assurer que monitoring alertera la prochaine anomalie.

Aller plus loin dans BAOI

Fiche mémo associéeSauvegarde / VSS Outils informatiquesCalculer, inspecter ou générer sans quitter le flux de diagnostic. ProcéduresSuivre une procédure de mise en œuvre contrôlée. Pannes connuesCroiser le symptôme avec les pannes et causes déjà documentées.
♡ 0