Tutoriel Linux

Smartctl w systemie Linux: sprawdzanie dysku przed awarią

Débutant6 min de lecture
À retenirLinux n'est pas réservé aux experts. Le bon point de départ : une distribution accessible, une sauvegarde propre et quelques commandes comprises.

Dysk może nadal reagować na polecenia, mimo że kumulują się niestabilne sektory, błędy nośnika lub występuje zaawansowane zużycie. Jeśli poczekasz na pierwszy błąd wejścia/wyjścia, aby sprawdzić jego status, proces tworzenia kopii zapasowej może się znacznie skomplikować.

smartctldostarczone przez pakiet smartmontoolsOdczytuje informacje SMART z dysków SATA, SAS i NVMe. Używam go do potwierdzenia wątpliwości, ale nigdy jako gwarancji: statusu PRZESZEDŁ Nie zapobiega to nagłej awarii. Celem jest porównanie ogólnego stanu, przydatnych liczników, autotestu i logów jądra przed podjęciem decyzji.

Tux sprawdza stan SMART dysku twardego przed jego awarią.
Smartctl pomaga w sprawdzeniu statusu SMART, błędów nośnika i autotestów przed wykonaniem kopii zapasowej lub wymianą dysku.

Zidentyfikuj dysk przed uruchomieniem smartctl

Nie zakładaj, że płyta, o której mowa, jest /dev/sdaNazwa może ulec zmianie po ponownym uruchomieniu lub dodaniu urządzenia. Zobacz modele, numery seryjne i typy połączeń:

lsblk -d -o NAZWA,ROZMIAR,MODEL,NUMER SERYJNY,TRANSAKCJA,TYP
lsblk -o NAZWA,ROZMIAR,STYLF,PUNKTY MONTAŻU,MODEL,NUMER SERYJNY

lsblk pod Linuksem szczegółowo opisuje tę identyfikację przed montażem lub formatowaniem.

Raz smartmontools Po zainstalowaniu narzędzia zapytaj je także, jakie urządzenia może ono otwierać:

sudo smartctl --scan-open

Na przykład praca na całym dysku /dev/sda Lub /dev/nvme0, nie w takim stopniu jak /dev/sda1.

sudo apt update
sudo apt install smartmontools

W systemach Fedora, Rocky Linux lub AlmaLinux:

sudo dnf install smartmontools

W Arch Linuxie:

sudo pacman -S smartmontools

Następnie sprawdź tożsamość dysku i dostępność SMART:

sudo smartctl -i /dev/sda

Musisz znaleźć model i numer seryjny widoczny na zdjęciu lsblkW obudowie USB-SATA, SMART można ukryć za mostkiem. Ten wariant współpracuje z niektórymi adapterami:

sudo smartctl -a -d sat /dev/sdb

Nie wymuszaj losowego typu urządzenia. Sprawdź wynik --skanuj-otwórz oraz dokumentację obudowy lub kontrolera RAID. Niektóre kontrolery wymagają specjalnej opcji dostępu do każdego dysku fizycznego.

Przeczytaj cały obraz, nie ufając ani jednemu słowu

Zacznij od ogólnego badania stanu zdrowia:

sudo smartctl -H /dev/sda

Wynik PRZESZEDŁ Oznacza to, że dysk nie przekroczył progu awaryjności określonego przez producenta. Nie oznacza to jednak, że jest nowy, wolny od błędów lub nie może ulec awarii w przyszłości. Wynik PRZEGRANY wymaga natychmiastowego wykonania kopii zapasowej i wymiany, a nie nowej serii testów w celu uzyskania pewności.

Następnie wyświetl pełny raport:


sudo smartctl -a /dev/nvme0

Najpierw sprawdź, czy model, numer seryjny i pojemność odpowiadają docelowemu dyskowi. Następnie sprawdź temperaturę, liczbę godzin pracy, dziennik błędów i wyniki autotestu. Opcja -X podaje więcej szczegółów kiedy -ma nie wystarczy:

sudo smartctl -x /dev/sda

Określ wskaźniki, które zmieniają decyzję

W przypadku dysku SATA należy zwrócić szczególną uwagę na Realokacja_Sektora_Ct, Bieżący_Oczekujący_Sektor I Offline Niemożliwy do naprawieniaSektory oczekujące lub niemożliwe do naprawienia, zwłaszcza jeśli ich liczba wzrasta, wymagają utworzenia kopii zapasowych i przygotowania do wymiany. Stabilny licznik realokowanych sektorów nie oznacza automatycznie awarii, ale powinien być monitorowany.

Liczba błędów UDMA_CRC Często wskazuje to na połączenie SATA: kabel, złącze, zasilacz lub kontroler. Jeśli ten licznik rośnie, sprawdź połączenia, a następnie ponownie przeczytaj raport. Nie myl błędu transmisji z uszkodzonym sektorem.

Na dysku SSD NVMe spójrz Krytyczne ostrzeżenie Dostępny zapasowy, Procent wykorzystania I Błędy integralności nośników i danychSpadek rezerwy poniżej progu, krytyczne ostrzeżenie lub rosnąca liczba błędów w mediach powinny skutkować podjęciem działań. Procent wykorzystania reprezentuje szacunek zużytej wytrzymałości, a nie dokładne odliczanie.

Nazwy, progi i wartości surowe różnią się w zależności od producenta. Zawsze należy porównywać kilka odczytów z tego samego dysku. Skopiowanie wartości surowej z innego modelu może łatwo doprowadzić do błędnej diagnozy.

Uruchom krótki test i pobierz jego wyniki.

Jeżeli dysk jest nadal dostępny i nie zgłasza już błędów wejścia/wyjścia, należy przeprowadzić krótki autotest:

sudo smartctl -t krótki /dev/sda

smartctl

sudo smartctl -l autotest /dev/sda
sudo smartctl -a /dev/sda

Wynik powinien zostać wyświetlony jako ukończony bez błędów. Przerwanie testu może być spowodowane wyłączeniem systemu, przejściem w tryb uśpienia lub innym poleceniem testowym. Nieudany test, w połączeniu z niestabilnymi sektorami lub błędami jądra, wzmacnia decyzję o wymianie dysku.

Długi test z smartctl -t długi Obejmuje większy obszar, ale trwa znacznie dłużej. Nie wykonuj go jako pierwszej czynności na dysku, który już uległ awarii. W takim przypadku odzyskaj wszystkie dane, które nadal można odczytać, zanim dodasz kolejne godziny aktywności.

Krzyżowe odwoływanie się do SMART z błędami jądra

SMART nie zastępuje logów Linuksa. Sprawdź błędy wiązania, resetowania i wejścia/wyjścia podczas bieżącego procesu rozruchu:

sudo journalctl -k -b -p warning..alert --no-pager
sudo dmesg -T | grep -Ei 'ata|nvme|błąd we/wy|reset|średni błąd"

dmesg i komunikaty jądra Pomaga odróżnić awarię dysku twardego od niestabilnego kabla USB, kontrolera lub zasilacza. Odczyt nasycenia zmierzony przez iostat również nie jest dowodem awarii fizycznej: opisuje obciążenie, a nie stan nośnika danych.

Przed naprawą systemu plików wykonaj kopię zapasową danych

Jeśli SMART zawiedzie, błędy nośników nasilają się lub jądro zgłasza błędy wejścia/wyjścia, zmniejsz liczbę zapisów i utwórz kopię zapasową ważnych danych. Na serwerze zdalnym sprawdź, czy kopia nadaje się do użytku przed każdym ponownym uruchomieniem.

Nie rzucaj fsck w celu przetestowania sprzętu. fsck Działa na spójność systemu plików i może znacząco obciążać i tak już delikatny sprzęt. Przewodnik po fsck pod Linuksem zaczyna się celowo od identyfikacji, demontażu i kontroli bez pisania.

W przypadku serwera NAS lub serwera, aktualizuj raporty SMART i monitoruj ich ewolucję. Przewodnik Linux dla domowego NAS-a Warto również pamiętać, że macierz RAID nie zastępuje kopii zapasowej. Dysk można wymienić, ale kopii danych nie.

Tam strona podręcznika smartctl przykłady z projektu smartmontools Pokaż główne raporty SATA i NVMe. Zachowaj tę kolejność: zidentyfikuj właściwy dysk, odczytaj pełny status, przeprowadź krótki test, jeśli dysk pozostaje stabilny, a następnie utwórz kopię zapasową lub wymień dysk, gdy tylko sygnały się zbiegną.

sudo apt update && sudo apt upgrade