Troubleshooting Linux: metodă practică pentru administratori
Troubleshooting-ul bun nu înseamnă să încerci comenzi la întâmplare. Înseamnă să delimitezi problema, să colectezi dovezi și să schimbi o singură variabilă odată.
Definește simptomul
Înlocuiește „serverul nu merge” cu o observație măsurabilă: portul 443 nu răspunde, filesystem-ul este read-only, load average este ridicat sau serviciul nu pornește după reboot. Cu cât simptomul este mai precis, cu atât diagnosticul este mai rapid.
Verifică ce s-a schimbat
Multe incidente apar după update-uri, deploy-uri, modificări de firewall, expirarea unui certificat sau umplerea discului. Corelează momentul apariției problemei cu schimbările recente.
Servicii și loguri
Folosește systemctl status și journalctl. Nu te opri la mesajul „failed”; citește liniile dinainte și după eroare și verifică logurile aplicației. Ghidul systemd detaliază fluxul.
CPU, memorie și procese
top, ps, free -h și informațiile din /proc ajută la identificarea consumului anormal. Verifică dacă problema este CPU, memorie, I/O sau un singur proces blocat.
Storage
Începe cu df -h și df -i. Un filesystem poate avea spațiu disponibil, dar inode-uri epuizate. Folosește du pentru directoare mari și inspectează mount-urile cu findmnt sau mount.
Rețea
Urmează traseul de jos în sus: interfață, adresă IP, rută, DNS, port, firewall, aplicație. ip, ss, ping, dig și curl oferă rapid dovezi.
Schimbă controlat
Fă backup la fișierele de configurare, notează comenzile și evită mai multe modificări simultan. Dacă faci trei schimbări și problema dispare, nu mai știi care a rezolvat-o și poți introduce efecte secundare.
Întrebări frecvente
Care este primul pas în troubleshooting Linux?
Definirea exactă a simptomului și verificarea schimbărilor recente.
Trebuie să dau restart serverului când ceva nu merge?
Restartul poate ascunde cauza și distruge dovezi utile. Este mai bine să colectezi informațiile relevante înainte, dacă situația permite.