Centre de supervision IT
Construisez un plan de supervision cohérent pour vos serveurs, équipements réseau, sauvegardes, services web, cloud et téléphonie.
Ajouter rapidement
Choisissez un modèle de supervision préconfiguré.
Éléments supervisés
Inventaire des actifs et services à surveiller.
| Type | Nom | IP / URL | Criticité | Disponibilité cible | Responsable | Notes |
|---|
Contrôles & seuils
Définissez ce qui doit déclencher une alerte.
| Équipement / service | Métrique | Warning | Critique | Fréquence | Fenêtre | Action attendue |
|---|
Alertes & escalade
Qui reçoit quoi, et dans quel délai.
| Niveau | Canal | Destinataire | Délai d’escalade | Plage horaire | Consigne |
|---|
Synthèse de couverture
Analyse simple des écarts dans le plan de supervision.
Couverture par type
Seuils recommandés
Exporter le plan de supervision
Pour documentation interne, audit, passation ou mise en production.
Plans locaux
Jusqu’à 10 plans enregistrés dans ce navigateur.
Aucun plan enregistré.
Mission du centre
8 playbooksTransformer une alerte en décision : valider qu’elle est réelle, mesurer l’impact, corréler dépendances, éviter les faux positifs et confirmer le retour à la normale avec des preuves.
Triage rapide
- Vérifier depuis au moins une seconde source avant action intrusive.
- Déterminer service métier impacté et dépendances.
- Comparer valeur actuelle, baseline et durée du dépassement.
- Corréler alertes simultanées pour trouver la cause racine.
- Noter acquittement, actions et heure du retour normal.
Arbre de décision
Tester réseau, gateway, alimentation/hyperviseur
Contrôler processus, port et dépendance du service.
Valider durée/tendance avant de changer le seuil.
Chercher dépendance commune avant traiter chaque alerte séparément.
Playbooks d’intervention
Commencer en lecture seule, collecter les preuves, puis ne modifier qu’une variable à la fois.
01Hôte déclaré downLecture / sans risque
Supervision perd ping/agent/SNMP sur un serveur ou équipement.
Vérifications
- Tester depuis un autre point réseau.
- Vérifier DNS, route et disponibilité de la gateway.
- Contrôler hyperviseur/alimentation si serveur.
Commandes / preuves
ping <host>tracert <host>Test-NetConnection <host> -Port <agent-port>Résultat attendu
La panne est localisée entre supervision, réseau, hôte ou agent.
Actions correctives
- Traiter la couche fautive puis forcer un check seulement après récupération.
- Éviter d’acquitter définitivement une alerte non comprise.
Escalader si
Plusieurs hôtes d’un même site down ou perte de management infrastructure.
02Service applicatif downModification contrôlée
Host répond mais service, URL ou port supervisé échoue.
Vérifications
- Tester port et service localement puis à distance.
- Lire logs et dépendances.
- Vérifier certificat/DNS/backend si service web.
Commandes / preuves
Get-Service <service>Test-NetConnection <host> -Port <port>curl -I https://<host>/Résultat attendu
Processus écoute et le test fonctionnel retourne le code attendu.
Actions correctives
- Corriger dépendance ou service puis retester depuis la sonde.
- Ne pas redémarrer automatiquement un service en boucle sans cause.
Escalader si
Service critique, redémarrages répétés ou backend partagé affecté.
03Faux positif récurrentModification contrôlée
Alerte se déclenche régulièrement sans impact réel.
Vérifications
- Comparer seuil, fenêtre et valeur réelle.
- Vérifier jitter de sonde, timeout et dépendances.
- Mesurer fréquence et durée des occurrences.
Commandes / preuves
ping -n 100 <host>Test-NetConnection <host> -Port <port>Get-DateRésultat attendu
La condition de faux positif est reproductible et quantifiée.
Actions correctives
- Ajuster durée/hystérésis/seuil sur la base des mesures.
- Conserver capacité à détecter une vraie panne.
Escalader si
Réglage masque de vrais incidents ou métrique elle-même non fiable.
04Espace disque sous seuilModification contrôlée
Volume passe sous seuil de capacité ou tendance annonce saturation.
Vérifications
- Mesurer libre et tendance de croissance.
- Identifier principale source de consommation.
- Vérifier snapshots/logs/backups selon rôle.
Commandes / preuves
Get-Volume | Sort-Object SizeRemainingGet-ChildItem <path> -Directory | Sort-Object LastWriteTimevssadmin list shadowstorageRésultat attendu
Une cause et un délai avant saturation sont estimés.
Actions correctives
- Nettoyer/réduire rétention ou étendre selon la cause.
- Ajuster seuil seulement si capacité normale le justifie.
Escalader si
Volume système critique ou croissance anormale rapide.
05CPU / mémoire au-dessus du seuilLecture / sans risque
Alerte ressources élevée pendant plusieurs minutes.
Vérifications
- Comparer pic ponctuel et saturation soutenue.
- Identifier processus dominant.
- Corréler à batch, backup ou charge utilisateur.
Commandes / preuves
Get-Process | Sort-Object CPU -Descending | Select -First 15Get-Counter \Processor(_Total)\% Processor Time,\Memory\Available MBytesGet-DateRésultat attendu
Le seuil reflète un impact réel ou un comportement planifié explicable.
Actions correctives
- Traiter cause avant d’augmenter le seuil.
- Créer fenêtre de maintenance pour charge planifiée si adapté.
Escalader si
Saturation persistante, OOM ou capacité structurelle insuffisante.
06Certificat proche expirationModification contrôlée
Alerte annonce certificat expirant dans quelques jours/semaines.
Vérifications
- Vérifier certificat réellement servi et nombre de jours.
- Identifier propriétaire et méthode de renouvellement.
- Contrôler si plusieurs nœuds/certificats sont concernés.
Commandes / preuves
openssl s_client -connect <host>:443 -servername <host> </dev/null 2>/dev/null | openssl x509 -noout -datescurl -vkI https://<host>/Résultat attendu
Échéance et processus de renouvellement sont connus avant fenêtre critique.
Actions correctives
- Planifier renouvellement avec marge et valider déploiement externe.
- Conserver alerte jusqu’au certificat effectivement présenté.
Escalader si
Certificat critique sans propriétaire ou automatisation en échec proche échéance.
07Alerte sauvegardeIntrusif / escalade
Supervision signale job absent, failed ou RPO dépassé.
Vérifications
- Vérifier dernier point réellement valide.
- Lire erreur du moteur de sauvegarde.
- Confirmer repository et VSS/snapshot.
Commandes / preuves
vssadmin list writersGet-VolumeGet-DateRésultat attendu
Le RPO réel est connu et un nouveau point peut être sécurisé.
Actions correctives
- Ouvrir incident sauvegarde si point attendu manquant.
- Ne pas acquitter sans confirmation du nouveau backup.
Escalader si
RPO critique dépassé ou aucune copie secondaire.
08Tempête d’alertesIntrusif / escalade
Des dizaines d’alertes arrivent presque simultanément sur plusieurs services.
Vérifications
- Regrouper par timestamp, site et dépendance commune.
- Identifier alerte racine la plus amont.
- Vérifier supervision elle-même et réseau de management.
Commandes / preuves
ping <gateway>Test-NetConnection <core-service> -Port <port>tracert <core-service>Résultat attendu
Une cause commune explique la majorité des symptômes secondaires.
Actions correctives
- Traiter cause racine avant les alertes dépendantes.
- Mettre en maintenance uniquement les objets réellement dépendants si nécessaire.
Escalader si
Panne site/core, supervision indisponible ou impossibilité de distinguer cause et effets.
Checklist de fin d’intervention
- Confirmer métrique revenue dans sa plage normale.
- Vérifier service depuis une seconde source.
- Fermer/annoter alerte avec cause et action.
- Ajuster seuil uniquement si mesure le justifie.
- Créer prévention ou capacité si l’incident peut récidiver.
Aller plus loin dans BAOI
Fiche mémo associéePorts réseau — repères supervision Outils informatiquesCalculer, inspecter ou générer sans quitter le flux de diagnostic. ProcéduresSuivre une procédure de mise en œuvre contrôlée. Pannes connuesCroiser le symptôme avec les pannes et causes déjà documentées.Bien exploiter le résultat
Méthode recommandée
- Utilisez une donnée représentative non sensible pour la préparation d’une supervision IT.
- Lancez l’opération puis relisez le résultat avant de le copier ou l’exporter.
- Validez la sortie dans l’application ou l’environnement cible avant de vous y fier.
Points à vérifier
- Confirmez le périmètre, les unités et les valeurs d’entrée avant d’interpréter le résultat.
- Distinguez le résultat observé de la décision opérationnelle qui en découle.
- Validez la conclusion sur le système cible, ses journaux ou sa configuration avant toute modification de production.
Questions fréquentes
Que faut-il documenter pour la préparation d’une supervision IT ?
Notez noms, identifiants, responsables, adressage ou sens des flux ainsi que la dépendance technique justifiant chaque entrée.
Comment garder le résultat utile dans le temps ?
Conservez une source de vérité claire, datez les changements et rapprochez régulièrement le document de la configuration réelle.
Que vérifier avant un changement de production ?
Comparez le plan avec les configurations de routage, commutation, pare-feu, DNS/DHCP et supervision déjà en place.