https://boiteaoutilsinformatique.fr/centre-supervision-it/
Boîte à Outils Informatique

Centre de supervision IT

Monitoring & exploitation

Centre de supervision IT

Construisez un plan de supervision cohérent pour vos serveurs, équipements réseau, sauvegardes, services web, cloud et téléphonie.

Ajouter rapidement

Choisissez un modèle de supervision préconfiguré.

Éléments supervisés

Inventaire des actifs et services à surveiller.

TypeNomIP / URLCriticitéDisponibilité cibleResponsableNotes

Contrôles & seuils

Définissez ce qui doit déclencher une alerte.

Équipement / serviceMétriqueWarningCritiqueFréquenceFenêtreAction attendue

Alertes & escalade

Qui reçoit quoi, et dans quel délai.

NiveauCanalDestinataireDélai d’escaladePlage horaireConsigne

Synthèse de couverture

Analyse simple des écarts dans le plan de supervision.

Couverture par type

Seuils recommandés

CPUWarning ≥ 80 % / Critique ≥ 95 %
RAMWarning ≥ 85 % / Critique ≥ 95 %
DisqueWarning ≤ 20 % libre / Critique ≤ 10 %
Latence WANWarning ≥ 100 ms / Critique ≥ 200 ms
Perte paquetsWarning ≥ 2 % / Critique ≥ 5 %
Certificat TLSWarning ≤ 30 j / Critique ≤ 7 j
SauvegardeAlerte dès 1 job critique en erreur
DisponibilitéContrôle toutes les 1 à 5 min selon criticité

Exporter le plan de supervision

Pour documentation interne, audit, passation ou mise en production.

Plans locaux

Jusqu’à 10 plans enregistrés dans ce navigateur.

Aucun plan enregistré.

À retenir : les seuils proposés sont des valeurs de départ. Adaptez-les à la charge habituelle, à la criticité métier et au comportement normal de chaque équipement.
Dépannage terrain

Mission du centre

8 playbooks

Transformer une alerte en décision : valider qu’elle est réelle, mesurer l’impact, corréler dépendances, éviter les faux positifs et confirmer le retour à la normale avec des preuves.

Triage rapide

  • Vérifier depuis au moins une seconde source avant action intrusive.
  • Déterminer service métier impacté et dépendances.
  • Comparer valeur actuelle, baseline et durée du dépassement.
  • Corréler alertes simultanées pour trouver la cause racine.
  • Noter acquittement, actions et heure du retour normal.

Arbre de décision

Host down→

Tester réseau, gateway, alimentation/hyperviseur

Service down mais host up→

Contrôler processus, port et dépendance du service.

Seuil ressource élevé→

Valider durée/tendance avant de changer le seuil.

Beaucoup d’alertes en même temps→

Chercher dépendance commune avant traiter chaque alerte séparément.

Playbooks d’intervention

Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.

01Hôte déclaré downLecture / sans risque
Symptôme

Supervision perd ping/agent/SNMP sur un serveur ou équipement.

Vérifications

  • Tester depuis un autre point réseau.
  • Vérifier DNS, route et disponibilité de la gateway.
  • Contrôler hyperviseur/alimentation si serveur.

Commandes / preuves

ping <host>tracert <host>Test-NetConnection <host> -Port <agent-port>

Résultat attendu

La panne est localisée entre supervision, réseau, hôte ou agent.

Actions correctives

  • Traiter la couche fautive puis forcer un check seulement après récupération.
  • Éviter d’acquitter définitivement une alerte non comprise.

Escalader si

Plusieurs hôtes d’un même site down ou perte de management infrastructure.

02Service applicatif downModification contrôlée
Symptôme

Host répond mais service, URL ou port supervisé échoue.

Vérifications

  • Tester port et service localement puis à distance.
  • Lire logs et dépendances.
  • Vérifier certificat/DNS/backend si service web.

Commandes / preuves

Get-Service <service>Test-NetConnection <host> -Port <port>curl -I https://<host>/

Résultat attendu

Processus écoute et le test fonctionnel retourne le code attendu.

Actions correctives

  • Corriger dépendance ou service puis retester depuis la sonde.
  • Ne pas redémarrer automatiquement un service en boucle sans cause.

Escalader si

Service critique, redémarrages répétés ou backend partagé affecté.

03Faux positif récurrentModification contrôlée
Symptôme

Alerte se déclenche régulièrement sans impact réel.

Vérifications

  • Comparer seuil, fenêtre et valeur réelle.
  • Vérifier jitter de sonde, timeout et dépendances.
  • Mesurer fréquence et durée des occurrences.

Commandes / preuves

ping -n 100 <host>Test-NetConnection <host> -Port <port>Get-Date

Résultat attendu

La condition de faux positif est reproductible et quantifiée.

Actions correctives

  • Ajuster durée/hystérésis/seuil sur la base des mesures.
  • Conserver capacité à détecter une vraie panne.

Escalader si

Réglage masque de vrais incidents ou métrique elle-même non fiable.

04Espace disque sous seuilModification contrôlée
Symptôme

Volume passe sous seuil de capacité ou tendance annonce saturation.

Vérifications

  • Mesurer libre et tendance de croissance.
  • Identifier principale source de consommation.
  • Vérifier snapshots/logs/backups selon rôle.

Commandes / preuves

Get-Volume | Sort-Object SizeRemainingGet-ChildItem <path> -Directory | Sort-Object LastWriteTimevssadmin list shadowstorage

Résultat attendu

Une cause et un délai avant saturation sont estimés.

Actions correctives

  • Nettoyer/réduire rétention ou étendre selon la cause.
  • Ajuster seuil seulement si capacité normale le justifie.

Escalader si

Volume système critique ou croissance anormale rapide.

05CPU / mémoire au-dessus du seuilLecture / sans risque
Symptôme

Alerte ressources élevée pendant plusieurs minutes.

Vérifications

  • Comparer pic ponctuel et saturation soutenue.
  • Identifier processus dominant.
  • Corréler à batch, backup ou charge utilisateur.

Commandes / preuves

Get-Process | Sort-Object CPU -Descending | Select -First 15Get-Counter \Processor(_Total)\% Processor Time,\Memory\Available MBytesGet-Date

Résultat attendu

Le seuil reflète un impact réel ou un comportement planifié explicable.

Actions correctives

  • Traiter cause avant d’augmenter le seuil.
  • Créer fenêtre de maintenance pour charge planifiée si adapté.

Escalader si

Saturation persistante, OOM ou capacité structurelle insuffisante.

06Certificat proche expirationModification contrôlée
Symptôme

Alerte annonce certificat expirant dans quelques jours/semaines.

Vérifications

  • Vérifier certificat réellement servi et nombre de jours.
  • Identifier propriétaire et méthode de renouvellement.
  • Contrôler si plusieurs nœuds/certificats sont concernés.

Commandes / preuves

openssl s_client -connect <host>:443 -servername <host> </dev/null 2>/dev/null | openssl x509 -noout -datescurl -vkI https://<host>/

Résultat attendu

Échéance et processus de renouvellement sont connus avant fenêtre critique.

Actions correctives

  • Planifier renouvellement avec marge et valider déploiement externe.
  • Conserver alerte jusqu’au certificat effectivement présenté.

Escalader si

Certificat critique sans propriétaire ou automatisation en échec proche échéance.

07Alerte sauvegardeIntrusif / escalade
Symptôme

Supervision signale job absent, failed ou RPO dépassé.

Vérifications

  • Vérifier dernier point réellement valide.
  • Lire erreur du moteur de sauvegarde.
  • Confirmer repository et VSS/snapshot.

Commandes / preuves

vssadmin list writersGet-VolumeGet-Date

Résultat attendu

Le RPO réel est connu et un nouveau point peut être sécurisé.

Actions correctives

  • Ouvrir incident sauvegarde si point attendu manquant.
  • Ne pas acquitter sans confirmation du nouveau backup.

Escalader si

RPO critique dépassé ou aucune copie secondaire.

08Tempête d’alertesIntrusif / escalade
Symptôme

Des dizaines d’alertes arrivent presque simultanément sur plusieurs services.

Vérifications

  • Regrouper par timestamp, site et dépendance commune.
  • Identifier alerte racine la plus amont.
  • Vérifier supervision elle-même et réseau de management.

Commandes / preuves

ping <gateway>Test-NetConnection <core-service> -Port <port>tracert <core-service>

Résultat attendu

Une cause commune explique la majorité des symptômes secondaires.

Actions correctives

  • Traiter cause racine avant les alertes dépendantes.
  • Mettre en maintenance uniquement les objets réellement dépendants si nécessaire.

Escalader si

Panne site/core, supervision indisponible ou impossibilité de distinguer cause et effets.

Checklist de fin d’intervention

  • Confirmer métrique revenue dans sa plage normale.
  • Vérifier service depuis une seconde source.
  • Fermer/annoter alerte avec cause et action.
  • Ajuster seuil uniquement si mesure le justifie.
  • Créer prévention ou capacité si l’incident peut récidiver.

Aller plus loin dans BAOI

Fiche mémo associéePorts réseau — repères supervision Outils informatiquesCalculer, inspecter ou générer sans quitter le flux de diagnostic. ProcéduresSuivre une procédure de mise en œuvre contrôlée. Pannes connuesCroiser le symptôme avec les pannes et causes déjà documentées.
Repères pratiques

Bien exploiter le résultat

Méthode recommandée

  1. Utilisez une donnée représentative non sensible pour la préparation d’une supervision IT.
  2. Lancez l’opération puis relisez le résultat avant de le copier ou l’exporter.
  3. Validez la sortie dans l’application ou l’environnement cible avant de vous y fier.

Points à vérifier

  • Confirmez le périmètre, les unités et les valeurs d’entrée avant d’interpréter le résultat.
  • Distinguez le résultat observé de la décision opérationnelle qui en découle.
  • Validez la conclusion sur le système cible, ses journaux ou sa configuration avant toute modification de production.
FAQ

Questions fréquentes

Que faut-il documenter pour la préparation d’une supervision IT ?

Notez noms, identifiants, responsables, adressage ou sens des flux ainsi que la dépendance technique justifiant chaque entrée.

Comment garder le résultat utile dans le temps ?

Conservez une source de vérité claire, datez les changements et rapprochez régulièrement le document de la configuration réelle.

Que vérifier avant un changement de production ?

Comparez le plan avec les configurations de routage, commutation, pare-feu, DNS/DHCP et supervision déjà en place.

♡ 0