Centre Windows Server
Diagnostic guidé et commandes prêtes à copier pour Active Directory, DNS, DHCP, GPO, RDP, services, stockage, VSS
dcdiag /e /c /vrepadmin /replsummaryrepadmin /showreplnetdom query fsmonltest /dsgetdc:exemple.localnslookup -type=SRV _ldap._tcp.dc._msdcs.exemple.localGet-DnsServerZoneGet-DnsServerForwarderGet-DhcpServerv4ScopeGet-DhcpServerv4ScopeStatisticsGet-DhcpServerv4OptionValuegpupdate /forcegpresult /h C:\Temp\gpresult.htmlTest-NetConnection -ComputerName <SERVEUR> -Port 3389quserGet-Service | Where-Object {$_.StartType -eq 'Automatic' -and $_.Status -ne 'Running'}sc.exe qc <SERVICE>Get-VolumeGet-PhysicalDiskchkdsk C: /scanvssadmin list writersvssadmin list providersvssadmin list shadowstoragecertutil -pulseGet-ChildItem Cert:\LocalMachine\MyDISM /Online /Cleanup-Image /ScanHealthDISM /Online /Cleanup-Image /RestoreHealthsfc /scannowipconfig /allTest-NetConnection -ComputerName <CIBLE> -Port 443route printGet-NetTCPConnectionGet-WinEvent -FilterHashtable @{LogName='System';Level=1,2} -MaxEvents 50Get-WinEvent -FilterHashtable @{LogName='System';Id=<ID>} -MaxEvents 30Générateur de recherche Event Viewer
DNS avant tout
Sur un domaine AD, commencez presque toujours par vérifier DNS et l’heure.
Ne restaurez pas un DC comme une VM ordinaire
Respectez les procédures Active Directory et votre logiciel de sauvegarde.
Regardez les Event ID voisins
Un événement isolé est rarement suffisant pour comprendre la cause.
Tester avant de réparer
Préférez les commandes de diagnostic non destructives avant les corrections.
Documenter les changements
Notez GPO, services, certificats et paramètres modifiés pendant l’intervention.
Vérifier la sauvegarde
Avant une opération risquée, assurez-vous qu’un point de restauration exploitable existe.
Mission du centre
8 playbooksIsoler rapidement si l’incident vient des ressources système, des services, d’Active Directory, du DNS, des GPO ou de la synchronisation horaire, avec des preuves avant toute modification.
Triage rapide
- Confirmer l’heure de début, le périmètre et les utilisateurs ou serveurs touchés.
- Vérifier CPU, mémoire, volumes et espace libre avant de redémarrer quoi que ce soit.
- Contrôler les services critiques et les événements System/Application récents.
- Valider DNS, passerelle et résolution des noms du domaine.
- Sur un DC, vérifier réplication, SYSVOL, heure et rôle des partenaires.
Arbre de décision
Commencer par CPU/RAM/disque puis identifier le processus ou l’I/O dominant.
Contrôler service, dépendances et événements avant un redémarrage ciblé.
Prioriser DNS, réplication AD, SYSVOL et synchronisation de l’heure.
Comparer avant/après, générer gpresult et revenir sur le changement le plus récent.
Playbooks d’intervention
Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.
01Serveur lent / CPU élevéLecture / sans risque
Sessions lentes, RDP difficile ou applications qui répondent mal sans erreur réseau évidente.
Vérifications
- Identifier le processus dominant et distinguer CPU, mémoire et I/O.
- Comparer la charge actuelle à l’heure du début d’incident.
- Chercher les erreurs applicatives ou système corrélées.
Commandes / preuves
Get-Process | Sort-Object CPU -Descending | Select-Object -First 15Get-Counter \Processor(_Total)\% Processor Time,\Memory\Available MBytesGet-WinEvent -LogName System -MaxEvents 50Résultat attendu
Les ressources restent sous contrôle et aucun processus ne monopolise durablement CPU, RAM ou disque.
Actions correctives
- Traiter le processus ou service identifié plutôt que redémarrer tout le serveur.
- Si la saturation est planifiée, corriger la tâche ou sa fenêtre d’exécution.
Escalader si
La saturation revient sans cause identifiable, implique un rôle critique ou provoque des pertes de service.
02Disque système presque pleinModification contrôlée
Volume C: critique, mises à jour en échec ou services qui ne peuvent plus écrire.
Vérifications
- Mesurer l’espace libre et repérer les volumes les plus tendus.
- Contrôler shadow copies, logs, dumps et répertoires temporaires.
- Vérifier si une croissance anormale est récente.
Commandes / preuves
Get-Volume | Sort-Object SizeRemainingvssadmin list shadowstorageGet-ChildItem C:\ -Force -ErrorAction SilentlyContinue | Sort-Object Length -Descending | Select-Object -First 20Résultat attendu
Une cause de consommation est identifiée avant suppression et une marge d’espace durable est restaurée.
Actions correctives
- Nettoyer uniquement les éléments identifiés comme sûrs ou ajuster leur rétention.
- Étendre le volume si la croissance est légitime et documentée.
Escalader si
Le volume contient des données métier non identifiées, des snapshots critiques ou le stockage sous-jacent est lui-même saturé.
03Service critique ne démarre plusModification contrôlée
Un rôle ou une application reste arrêté après démarrage du serveur ou redémarrage du service.
Vérifications
- Lire l’état, le type de démarrage et les dépendances.
- Corréler les événements Service Control Manager et applicatifs.
- Vérifier compte de service, droits et ressources externes.
Commandes / preuves
Get-Service <Service> | Format-List *sc.exe qc <Service>Get-WinEvent -FilterHashtable @{LogName="System"; ProviderName="Service Control Manager"} -MaxEvents 30Résultat attendu
La dépendance fautive ou le code d’erreur explique pourquoi le service ne passe pas à Running.
Actions correctives
- Corriger la dépendance ou le compte avant un nouveau démarrage ciblé.
- Conserver les événements et l’heure exacte pour l’analyse éditeur si nécessaire.
Escalader si
Le service manipule une base critique, refuse toujours de démarrer ou une corruption est suspectée.
04GPO non appliquéeLecture / sans risque
Un paramètre utilisateur ou ordinateur attendu n’est pas présent sur une ou plusieurs machines.
Vérifications
- Confirmer l’OU, le filtrage sécurité/WMI et l’héritage.
- Comparer la GPO attendue à la liste réellement appliquée.
- Vérifier accès SYSVOL et erreurs GroupPolicy.
Commandes / preuves
gpresult /h C:\Temp\gpresult.htmlgpupdate /forceGet-WinEvent -LogName Microsoft-Windows-GroupPolicy/Operational -MaxEvents 50Résultat attendu
La GPO apparaît comme appliquée ou une raison explicite de refus/filtrage est visible.
Actions correctives
- Corriger le scope ou filtrage plutôt que multiplier les gpupdate.
- Valider sur un poste pilote avant généralisation.
Escalader si
SYSVOL est inaccessible, plusieurs DC divergent ou les erreurs touchent tout le domaine.
05Réplication Active Directory en erreurIntrusif / escalade
Objets incohérents entre DC, erreurs de réplication ou authentifications aléatoires.
Vérifications
- Résumer les erreurs par DC et partenaire.
- Vérifier DNS, connectivité RPC et heure entre contrôleurs.
- Contrôler la santé SYSVOL/DFSR.
Commandes / preuves
repadmin /replsummaryrepadmin /showrepl * /errorsonlydcdiag /e /test:replications /test:dnsRésultat attendu
Tous les partenaires répliquent sans erreur récente et les délais restent cohérents.
Actions correctives
- Corriger DNS/routage/heure avant toute action intrusive sur la réplication.
- Documenter le DC source, destination et code exact avant escalade.
Escalader si
USN rollback, lingering objects, base NTDS suspecte ou plusieurs DC deviennent non fiables.
06DNS du domaine incohérentLecture / sans risque
Résolution intermittente, jointure domaine impossible ou services AD non découverts.
Vérifications
- Vérifier les DNS configurés sur le serveur et éviter les DNS publics sur les membres du domaine.
- Tester les enregistrements SRV du domaine.
- Comparer réponse courte/FQDN et reverse si nécessaire.
Commandes / preuves
Get-DnsClientServerAddressResolve-DnsName _ldap._tcp.dc._msdcs.<domaine> -Type SRVnltest /dsgetdc:<domaine>Résultat attendu
Les clients utilisent les DNS AD et les SRV retournent des DC joignables.
Actions correctives
- Corriger la configuration DNS client/DHCP avant de modifier les zones.
- Nettoyer uniquement les enregistrements réellement obsolètes après vérification.
Escalader si
Zones AD intégrées divergentes, erreurs de réplication DNS ou disparition de plusieurs SRV critiques.
07Relation d’approbation rompueModification contrôlée
Message de relation d’approbation entre la station et le domaine ou authentification machine défaillante.
Vérifications
- Tester le secure channel sans le réparer immédiatement.
- Valider DNS, heure et disponibilité d’un DC.
- Vérifier que l’objet ordinateur existe et n’a pas été restauré incohérent.
Commandes / preuves
Test-ComputerSecureChannel -Verbosenltest /sc_verify:<domaine>w32tm /query /statusRésultat attendu
Le secure channel est True et le poste localise un DC cohérent.
Actions correctives
- Réparer avec des identifiants autorisés seulement après validation DNS/heure.
- Éviter de sortir/réintégrer le domaine comme première action.
Escalader si
Le problème touche plusieurs machines, un snapshot ancien a été restauré ou le DC lui-même est suspect.
08Kerberos / synchronisation de l’heureLecture / sans risque
Échecs Kerberos, demandes répétées d’identifiants ou accès refusés sans changement de droits.
Vérifications
- Mesurer la dérive horaire et identifier la source NTP.
- Vérifier les tickets Kerberos et le DC utilisé.
- Sur le PDC Emulator, confirmer la source de temps autoritative.
Commandes / preuves
w32tm /query /statusw32tm /query /sourceklistRésultat attendu
Les horloges restent synchronisées et les tickets sont émis par le domaine sans dérive excessive.
Actions correctives
- Corriger la hiérarchie NTP avant de purger ou renouveler les tickets.
- Après correction, retester une authentification neuve.
Escalader si
La source NTP du domaine est instable, plusieurs sites dérivent ou les KDC signalent des erreurs persistantes.
Checklist de fin d’intervention
- Confirmer que le symptôme initial n’est plus reproductible.
- Relire les événements critiques après correction.
- Tester depuis au moins un client représentatif.
- Documenter commande, résultat et changement effectué.
- Prévoir une surveillance si la cause pouvait récidiver.