TechPro

Comment analyser les logs système (journald, syslog, dmesg) pour identifier une panne matérielle ou système imminente ?

Attendre que votre serveur s’éteigne pour agir est une erreur critique. Le noyau Linux et le système d’exploitation envoient des signaux d’alerte bien avant la panne finale. Voici comment les traquer.

dmesg : Le journal du noyau (Kernel)

dmesg affiche les messages du tampon circulaire du noyau. C’est l’outil numéro un pour repérer les défaillances physiques directes.

  • Vérifier les erreurs d’écriture disque / SATA :

    Bash

    dmesg | grep -Ei "ata|scsi|sd|sector|ext4|io error"
    

    Signe d’alerte : Des erreurs de type I/O error ou Buffer I/O error on dev sda indiquent que votre disque dur ou SSD est en train de rendre l’âme.

  • Traquer l’instabilité de la mémoire RAM :

    Bash

    dmesg | grep -i "MCE"
    

    Signe d’alerte : Les erreurs MCE (Machine Check Exception) sont générées directement par le processeur lorsqu’il détecte une défaillance matérielle (souvent un problème de RAM ECC ou de surchauffe CPU).

journald et syslog : Les journaux du système

Avec systemd, journalctl centralise la majorité des logs.

  • Lister uniquement les erreurs graves et critiques depuis le dernier démarrage :

    Bash

    journalctl -p 0..3 -b
    

    (Le paramètre -p 0..3 cible les niveaux Emergency, Alert, Critical et Error).

  • Surveiller les kills par manque de mémoire (Out of Memory) : Si votre serveur s’arrête de répondre de façon aléatoire ou si vos services (comme MySQL) coupent tout seuls :

    Bash

    journalctl -ke | grep -i "oom-killer"
    

    L’OOM-Killer intervient pour tuer les processus gourmands lorsque la RAM est totalement saturée.

 

Share: