Centre Sauvegarde & PRA
Diagnostic sauvegarde, restauration, immutabilité, réplication, RPO/RTO et capacité.
vssadmin list writersvssadmin list providersvssadmin list shadowstorageGet-VolumeGet-PhysicalDiskGet-NetAdapterStatisticsGet-VM | Get-SnapshotGet-Datastore | Select Name,CapacityGB,FreeSpaceGBdf -hdu -sh <CHEMIN>Get-FileHash <FICHIER>Test-Path <CHEMIN_BACKUP>Calcul RPO / RTO
Estimation capacité
Mission du centre
8 playbooksDiagnostiquer une sauvegarde en protégeant d’abord les chaînes de restauration : job, source, snapshot
Triage rapide
- Identifier dernier point de restauration réellement réussi.
- Lire code d’erreur du job et étape exacte en échec.
- Vérifier espace et santé repository avant relance.
- Sur Windows, vérifier VSS writers/providers si snapshot échoue.
- Ne jamais purger manuellement une chaîne sans comprendre la rétention.
Arbre de décision
Traiter writer/provider/espace avant le moteur de sauvegarde.
Inspecter repository, réseau, quota et chaîne.
Faire un test de restauration isolé : succès du job ≠ restauration validée.
Mesurer gap, sécuriser un nouveau point puis analyser la cause.
Playbooks d’intervention
Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.
01Job de sauvegarde en échecLecture / sans risque
Job passe en Failed/Warning ou n’atteint pas son dernier point.
Vérifications
- Lire première erreur causale et non seulement la dernière ligne.
- Vérifier source joignable et credentials.
- Contrôler repository, quota et réseau.
Commandes / preuves
Get-Service VSSGet-Volume | Sort-Object SizeRemainingTest-NetConnection <repository> -Port <port>Résultat attendu
L’étape fautive est identifiée : source, snapshot, transfert ou repository.
Actions correctives
- Corriger la première cause puis relancer un job contrôlé.
- Conserver logs et job ID avant nettoyage.
Escalader si
Chaîne de restauration critique, corruption suspectée ou plusieurs jobs échouent simultanément.
02VSS writer en erreurModification contrôlée
Snapshot Windows échoue avec writer Failed/Retryable error.
Vérifications
- Lister tous les writers et noter le writer fautif.
- Contrôler service associé et événements VSS/SPP.
- Vérifier shadow storage et espace libre.
Commandes / preuves
vssadmin list writersvssadmin list providersvssadmin list shadowstorageGet-WinEvent -LogName Application -MaxEvents 100 | ? ProviderName -match "VSS|SPP"Résultat attendu
Tous les writers critiques sont Stable / No error avant nouvelle sauvegarde.
Actions correctives
- Redémarrer uniquement le service lié si procédure et impact maîtrisés.
- Éviter reboot aveugle avant d’avoir identifié le writer.
Escalader si
Writer applicatif base de données critique, erreurs récurrentes ou provider tiers.
03Repository presque pleinIntrusif / escalade
Sauvegardes échouent faute d’espace ou rétention ne libère plus assez.
Vérifications
- Mesurer capacité, croissance et marge nécessaire au prochain job.
- Comprendre chaîne full/incremental et rétention.
- Vérifier snapshots storage/object-lock qui empêchent purge.
Commandes / preuves
Get-Volume | Sort-Object SizeRemainingGet-ChildItem <repo> -Directory | Sort-Object LastWriteTimefsutil volume diskfree <drive>Résultat attendu
Une capacité suffisante existe pour terminer job + merge/rétention sans casser la chaîne.
Actions correctives
- Étendre repository ou réduire rétention via le logiciel de sauvegarde.
- Ne jamais supprimer directement des fichiers de chaîne.
Escalader si
Espace critique immédiat, immutabilité empêche purge ou chaîne dépend de fichiers anciens.
04Point de restauration attendu absentLecture / sans risque
Date/heure nécessaire n’apparaît pas dans la console ou le catalogue.
Vérifications
- Comparer planning, historique job et rétention.
- Vérifier si job était disabled, skipped ou failed.
- Contrôler copy job/offsite si seconde copie attendue.
Commandes / preuves
Get-DateGet-ScheduledTask | ? TaskName -match "backup"Get-WinEvent -LogName System -MaxEvents 100Résultat attendu
Chaque intervalle RPO attendu correspond à un point ou à un échec documenté.
Actions correctives
- Sécuriser un nouveau point complet si le gap est encore ouvert.
- Corriger planification/monitoring qui a laissé passer le manque.
Escalader si
RPO contractuel dépassé, perte de points due à corruption ou besoin métier dans la fenêtre manquante.
05Restauration échoueIntrusif / escalade
Point visible mais restauration fichier/VM/base échoue ou produit une donnée inutilisable.
Vérifications
- Tester un autre point et une cible isolée.
- Lire erreur de lecture, checksum, permission ou espace.
- Vérifier dépendances applicatives après restauration.
Commandes / preuves
Get-FileHash <restored-file>Get-VolumeTest-Path <restore-target>Résultat attendu
La restauration produit des données lisibles et validables sans altérer la production.
Actions correctives
- Toujours valider en zone isolée avant overwrite de production.
- Tester plusieurs points pour délimiter une corruption éventuelle.
Escalader si
Plusieurs points sont illisibles, base métier critique ou overwrite irréversible envisagé.
06RPO dépasséIntrusif / escalade
Dernier backup valide est plus ancien que l’objectif métier.
Vérifications
- Calculer âge exact du dernier point valide.
- Identifier données modifiées depuis ce point.
- Vérifier si une autre copie ou réplication couvre le gap.
Commandes / preuves
Get-DateGet-Item <last-backup> | Select LastWriteTimeGet-VolumeRésultat attendu
Le gap de protection est quantifié et une action immédiate permet de réduire le risque.
Actions correctives
- Déclencher un point sécurisé dès que la source/repository est sain.
- Informer selon procédure si SLA/RPO est franchi.
Escalader si
RPO métier dépassé sur système critique ou aucune copie secondaire disponible.
07Suspicion ransomware — protéger les sauvegardesIntrusif / escalade
Chiffrement, suppression massive ou compte compromis menace aussi repository/console.
Vérifications
- Vérifier immutabilité/offline copy sans monter les sauvegardes inutilement.
- Identifier comptes ayant accès au repository et console.
- Geler suppressions/rétention automatiques si procédure le permet.
Commandes / preuves
Get-SmbSessionGet-SmbShareAccess -Name <share>Get-LocalGroupMember AdministratorsRésultat attendu
Au moins une copie saine, isolée et non modifiable est préservée.
Actions correctives
- Isoler les chemins de backup de l’incident avant restauration.
- Changer credentials backup depuis un poste sain selon plan de réponse.
Escalader si
Repository chiffré, immutabilité douteuse ou attaque active sur infrastructure de sauvegarde.
08Test PRA / restauration de validationModification contrôlée
Les backups sont verts mais aucune restauration récente n’a prouvé le PRA.
Vérifications
- Choisir charge représentative et environnement isolé.
- Définir RTO/RPO et critères de succès avant le test.
- Tester identité, réseau, application et cohérence des données.
Commandes / preuves
Get-DateTest-NetConnection <restored-service> -Port <port>Get-FileHash <reference-file>Résultat attendu
Le service restauré démarre dans le RTO et les données correspondent au point attendu.
Actions correctives
- Documenter écarts de temps, dépendances et étapes manuelles.
- Mettre à jour PRA avec les enseignements du test.
Escalader si
RTO/RPO non tenus ou restauration dépend de connaissances non documentées.
Checklist de fin d’intervention
- Confirmer un nouveau point valide après correction.
- Vérifier repository, rétention et seconde copie.
- Effectuer au moins un contrôle de restauration si pertinent.
- Documenter RPO réel et incident du job.
- S’assurer que monitoring alertera la prochaine anomalie.