Tutoriel Linux

Smartctl v Linuxu: kontrola disku před jeho selháním

Débutant6 min de lecture
À retenirLinux n'est pas réservé aux experts. Le bon point de départ : une distribution accessible, une sauvegarde propre et quelques commandes comprises.

Disk může i přes hromadění nestabilních sektorů, chyb média nebo pokročilého opotřebení reagovat na příkazy. Pokud s kontrolou jeho stavu čekáte na první chybu I/O, proces zálohování se může zkomplikovat.

smartctl smartmontoolsČte informace SMART z disků SATA, SAS a NVMe. Používám ho k potvrzení pochybností, ale nikdy ne jako záruku: stav… PROSTĚNO

Tux kontroluje stav SMART pevného disku před jeho selháním.
Nástroj Smartctl pomáhá s křížovým odkazem na stav testu SMART, chyby médií a autotesty před zálohováním nebo výměnou disku.

Před spuštěním programu smartctl identifikujte disk

Nepředpokládejte, že daný disk je /dev/sdaJeho název se může změnit po restartu nebo přidání zařízení. Zobrazit modely, sériová čísla a typy připojení:

lsblk -d -o NÁZEV,VELIKOST,MODEL,SÉRIOVÉ ČÍSLO,TRANSAKCE,TYP
lsblk -o NÁZEV,VELIKOST,TYPFS,PŘIPOJOVACÍBODY,MODEL,SÉRIOVÉČÍSLO

První příkaz vypíše fyzická bloková zařízení. Druhý umožňuje propojit disk s jeho oddíly a body připojení. Pokud má několik modelů stejnou kapacitu, sériové číslo zabrání nákladné chybě. Průvodce na lsblk v Linuxu podrobně popisuje tuto identifikaci před sestavením nebo formátováním.

Jednou smartmontools Po instalaci se také zeptejte nástroje, která zařízení dokáže otevřít:

sudo smartctl --scan-open

Pracujte například na celém disku /dev/sda Nebo /dev/nvme0, ne na základě skóre jako /dev/sda1.

Nainstalujte smartmontools a ověřte podporu SMART

V Debianu nebo Ubuntu:

aktualizace sudo apt
sudo apt install smartmontools

Na Fedoře, Rocky Linuxu nebo AlmaLinuxu:

sudo dnf nainstalujte smartmontools

Na Arch Linuxu:

sudo pacman -S smartmontools

Dále zkontrolujte identitu disku a dostupnost technologie SMART:

sudo smartctl -i /dev/sda

Musíte najít model a sériové číslo, které se zobrazuje u lsblkNa boxu s USB-SATA lze SMART skrýt za můstkem. Tato varianta funguje s určitými adaptéry:

sudo smartctl -a -d sat /dev/sdb

Nevynucujte náhodný typ zařízení. Zkontrolujte výsledek --scan-open a dokumentaci k RAID boxu nebo řadiči. Některé řadiče vyžadují specifickou možnost pro přístup ke každému fyzickému disku.

Přečtěte si celkový obraz, aniž byste věřili jedinému slovu

Začněte s celkovým zdravotním testem:

sudo smartctl -H /dev/sda

PROSTĚNO To znamená, že disk nepřekročil prahovou hodnotu selhání definovanou výrobcem. Neznamená to, že je nový, bezchybný nebo neschopný selhat zítra. Výsledek SELHLA vyžaduje okamžitou zálohu a výměnu, nikoli novou sérii testů pro ujištění.

Pak zobrazte celou zprávu:

sudo smartctl -a /dev/sda
sudo smartctl -a /dev/nvme0

Nejprve ověřte, zda model, sériové číslo a kapacita odpovídají cílovému disku. Poté zkontrolujte teplotu, provozní hodiny, protokol chyb a výsledky autotestu. Možnost -x poskytuje další podrobnosti, kdy -má nestačí:

sudo smartctl -x /dev/sda

Identifikujte metriky, které ovlivňují rozhodnutí

U disku SATA věnujte zvláštní pozornost Reallocated_Sector_Ct, Aktuální_čekající_sektor A Offline NeopravitelnéČekající nebo neopravitelné sektory, zejména pokud se jejich počet zvyšuje, vyžadují zálohování a přípravu k nahrazení. Stabilní počítadlo realokovaných sektorů automaticky neznamená selhání, ale měl by být monitorován.

Počet chyb UDMA_CRC_Error_Count To často ukazuje na připojení SATA: kabel, konektor, napájecí zdroj nebo řadič. Pokud toto počítadlo roste, zkontrolujte připojení a poté si znovu přečtěte zprávu. Nezaměňujte chybu přenosu s vadným sektorem.

Na NVMe SSD disku se podívejte Kritické varování, K dispozici Náhradní, Použité procento Chyby integrity médií a dat Použité procento představuje odhad spotřebované výdrže, nikoli přesný odpočet.

Názvy, prahové hodnoty a nezpracované hodnoty se liší v závislosti na výrobci. Vždy porovnávejte několik naměřených hodnot ze stejného disku. Kopírování nezpracované hodnoty z jiného modelu může snadno vést k chybné diagnóze.

Spusťte krátký test a poté si získejte jeho výsledek.

Pokud je disk stále přístupný a již nevrací chyby vstupu/výstupu, spusťte krátký autotest:

sudo smartctl -t short /dev/sda

smartctl označuje přibližný čas dokončení. Test se spustí na disku a příkaz okamžitě vrátí řízení. Nespouštějte ho však v obdobích velkého zatížení úložiště. Po uplynutí časového limitu zkontrolujte protokol:

sudo smartctl -l selftest /dev/sda
sudo smartctl -a /dev/sda

Výsledek by se měl jevit jako dokončený bez chyb. Přerušený test může být způsoben vypnutím systému, režimem spánku nebo jiným testovacím příkazem. Neúspěšný test v kombinaci s nestabilními sektory nebo chybami jádra posiluje rozhodnutí o výměně disku.

Dlouhý test s smartctl -t long Pokrývá větší oblast, ale trvá mnohem déle. Nepoužívejte to jako první akci na disku, který již selhává. V takovém případě obnovte všechna data, která jsou stále čitelná, než přidáte další hodiny aktivity.

Křížové odkazování na SMART s chybami jádra

SMART nenahrazuje protokoly Linuxu. Během aktuálního procesu spouštění hledejte chyby vazby, resety a chyby I/O:

sudo journalctl -k -b -p varování..alert --no-pager
sudo dmesg -T | grep -Ei 'ata|nvme|i/o error|reset|střední chyba'

Výukový program na dmesg a zprávy jádra Pomáhá rozlišit vadný pevný disk od nestabilního kabelu USB, řadiče nebo napájecího zdroje. Hodnota saturace naměřená pomocí nástroje iostat také není důkazem fyzického selhání: popisuje zátěž, nikoli stav paměťového média.

Před opravou souborového systému si zálohujte data

Pokud selže protokol SMART, zvýší se počet chyb médií nebo jádro hlásí chyby vstupu/výstupu, snižte počet zápisů a zálohujte důležitá data. Na vzdáleném serveru před restartem ověřte, zda je kopie použitelná.

Neházejte fsck otestovat zařízení. fsck Pracuje na konzistenci souborového systému a může značně zatěžovat již tak křehký hardware. Průvodce na fsck v Linuxu začíná záměrně identifikací, rozebráním a prohlídkou bez písemného projevu.

V případě NAS nebo serveru uchovávejte aktuální SMART reporty a sledujte jejich vývoj. Průvodce Také je dobré si uvědomit, že pole RAID nenahrazuje zálohu. Disk lze vyměnit, ale kopie dat nikoli.

Tam Manuální stránka smartctl dokumentuje možnosti, typy zařízení a autotesty. příklady z projektu smartmontools zobrazit hlavní zprávy SATA a NVMe. Dodržujte toto pořadí: identifikujte správný disk, přečtěte si celý stav, spusťte krátký test, pokud disk zůstane stabilní, a poté jej zálohujte nebo vyměňte, jakmile se signály sblíží.

sudo apt update && sudo apt upgrade