Ceph — HEALTH_ERR
Que signifie cette erreur ?
Ceph signale un état critique nécessitant une analyse des OSD, PG, capacité ou moniteurs.
Causes probables
- configuration ou dépendance incorrecte
- service, réseau ou stockage indisponible
- changement récent ou composant défaillant
Vérifications et résolution
- Conserver le message complet et l’heure de l’erreur.
- Identifier le composant exact qui renvoie le code.
- Contrôler les dépendances avant toute réparation globale.
- Appliquer une correction ciblée puis retester.
Approfondissement et preuve primaire
`HEALTH_ERR` est le niveau de santé critique de Ceph ; il indique qu’au moins un health check actif est classé erreur. Ce n’est pas une cause unique. Des PG indisponibles, un pool plein, des OSD manquants ou d’autres contrôles peuvent produire cet état. Le nom exact de chaque health check est donc l’information diagnostique principale.
Vérification approfondie
Exécuter `ceph health detail`, relever tous les identifiants actifs puis traiter chacun selon sa documentation avant de modifier les seuils. Vérifier capacité, PG, OSD, MON et réseau selon les checks présents. Ne pas masquer un health check pour obtenir artificiellement `HEALTH_OK` ; la cause opérationnelle doit être supprimée ou explicitement acceptée avec une justification.
Critère de validation
La résolution est validée lorsque les health checks responsables disparaissent après correction et que le cluster revient à l’état attendu sans perte de disponibilité ou de redondance. Confirmer aussi la récupération des PG et l’absence de nouvel état nearfull/full, car un `HEALTH_OK` immédiat après une action ne prouve pas encore la stabilité du cluster.
Référence primaire : Ceph Documentation — Health Checks.