Définition simple
La surveillance continue de l’état et des performances des systèmes.
Définition technique
La surveillance continue de l’état et des performances des systèmes. Ce concept est utilisé pour structurer l’exploitation, la supervision et le support du système d’information.
À quoi cela sert ?
Mieux organiser le support, la documentation et la disponibilité des services.
Exemple concret
Exemple : ce concept peut être utilisé pour structurer le traitement d’une panne ou d’un changement.
Problèmes fréquents
- Documentation incomplète
- Priorité mal définie
- Suivi insuffisant
Termes associés
Supervision synthétique · Incident IT · CMDB
Approfondissement et preuve primaire
Le monitoring transforme des métriques, états et événements en signaux exploitables sur la santé d’un système. Une bonne supervision distingue disponibilité, performance, capacité et erreur, puis relie chaque alerte à une action possible. Accumuler des métriques sans objectif ni seuil contextualisé produit du bruit plutôt qu’une meilleure observabilité.
Vérification approfondie
Pour construire un contrôle utile, définir d’abord ce que l’on cherche à protéger : service rendu, saturation, latence, taux d’erreur ou capacité. Vérifier la fréquence de collecte, les labels, la rétention et la qualité de la source. Les alertes doivent être testées sur des valeurs connues pour éviter les seuils impossibles ou les périodes trop courtes.
Critère de validation
Le dispositif est validé lorsqu’une dégradation contrôlée déclenche l’alerte attendue avec assez de contexte pour agir, puis se résout lorsque le service revient à la normale. Il faut également vérifier l’absence de doublons, la capacité à distinguer panne réelle et maintenance et la disponibilité de l’historique nécessaire à l’analyse.
Référence primaire : Prometheus — Overview and monitoring model.