Code erreur

Ceph — HEALTH_ERR

Ceph signale un état critique nécessitant une analyse des OSD, PG, capacité ou moniteurs.

ThématiqueProxmox VE →
Voir mes favoris

Ceph — HEALTH_ERR

Domaine : Stockage & VirtualisationPriorité : Critique

Que signifie cette erreur ?

Ceph signale un état critique nécessitant une analyse des OSD, PG, capacité ou moniteurs.

Causes probables

  • configuration ou dépendance incorrecte
  • service, réseau ou stockage indisponible
  • changement récent ou composant défaillant

Vérifications et résolution

  1. Conserver le message complet et l’heure de l’erreur.
  2. Identifier le composant exact qui renvoie le code.
  3. Contrôler les dépendances avant toute réparation globale.
  4. Appliquer une correction ciblée puis retester.
Précaution : Éviter les scripts de réparation génériques ou les suppressions irréversibles avant d’avoir confirmé la cause.

← Revenir à la base des codes d’erreur

Approfondissement et preuve primaire

`HEALTH_ERR` est le niveau de santé critique de Ceph ; il indique qu’au moins un health check actif est classé erreur. Ce n’est pas une cause unique. Des PG indisponibles, un pool plein, des OSD manquants ou d’autres contrôles peuvent produire cet état. Le nom exact de chaque health check est donc l’information diagnostique principale.

Vérification approfondie

Exécuter `ceph health detail`, relever tous les identifiants actifs puis traiter chacun selon sa documentation avant de modifier les seuils. Vérifier capacité, PG, OSD, MON et réseau selon les checks présents. Ne pas masquer un health check pour obtenir artificiellement `HEALTH_OK` ; la cause opérationnelle doit être supprimée ou explicitement acceptée avec une justification.

Critère de validation

La résolution est validée lorsque les health checks responsables disparaissent après correction et que le cluster revient à l’état attendu sans perte de disponibilité ou de redondance. Confirmer aussi la récupération des PG et l’absence de nouvel état nearfull/full, car un `HEALTH_OK` immédiat après une action ne prouve pas encore la stabilité du cluster.

Référence primaire : Ceph Documentation — Health Checks.

♡ 0