Disk může i přes hromadění nestabilních sektorů, chyb média nebo pokročilého opotřebení reagovat na příkazy. Pokud s kontrolou jeho stavu čekáte na první chybu I/O, proces zálohování se může zkomplikovat.
smartctl smartmontoolsČte informace SMART z disků SATA, SAS a NVMe. Používám ho k potvrzení pochybností, ale nikdy ne jako záruku: stav… PROSTĚNO

Před spuštěním programu smartctl identifikujte disk
Nepředpokládejte, že daný disk je /dev/sdaJeho název se může změnit po restartu nebo přidání zařízení. Zobrazit modely, sériová čísla a typy připojení:
lsblk -d -o NÁZEV,VELIKOST,MODEL,SÉRIOVÉ ČÍSLO,TRANSAKCE,TYP
lsblk -o NÁZEV,VELIKOST,TYPFS,PŘIPOJOVACÍBODY,MODEL,SÉRIOVÉČÍSLO
První příkaz vypíše fyzická bloková zařízení. Druhý umožňuje propojit disk s jeho oddíly a body připojení. Pokud má několik modelů stejnou kapacitu, sériové číslo zabrání nákladné chybě. Průvodce na lsblk v Linuxu podrobně popisuje tuto identifikaci před sestavením nebo formátováním.
Jednou smartmontools Po instalaci se také zeptejte nástroje, která zařízení dokáže otevřít:
sudo smartctl --scan-open
Pracujte například na celém disku /dev/sda Nebo /dev/nvme0, ne na základě skóre jako /dev/sda1.
Nainstalujte smartmontools a ověřte podporu SMART
V Debianu nebo Ubuntu:
aktualizace sudo apt
sudo apt install smartmontools
Na Fedoře, Rocky Linuxu nebo AlmaLinuxu:
sudo dnf nainstalujte smartmontools
Na Arch Linuxu:
sudo pacman -S smartmontools
Dále zkontrolujte identitu disku a dostupnost technologie SMART:
sudo smartctl -i /dev/sda
Musíte najít model a sériové číslo, které se zobrazuje u lsblkNa boxu s USB-SATA lze SMART skrýt za můstkem. Tato varianta funguje s určitými adaptéry:
sudo smartctl -a -d sat /dev/sdb
Nevynucujte náhodný typ zařízení. Zkontrolujte výsledek --scan-open a dokumentaci k RAID boxu nebo řadiči. Některé řadiče vyžadují specifickou možnost pro přístup ke každému fyzickému disku.
Přečtěte si celkový obraz, aniž byste věřili jedinému slovu
Začněte s celkovým zdravotním testem:
sudo smartctl -H /dev/sda
PROSTĚNO To znamená, že disk nepřekročil prahovou hodnotu selhání definovanou výrobcem. Neznamená to, že je nový, bezchybný nebo neschopný selhat zítra. Výsledek SELHLA vyžaduje okamžitou zálohu a výměnu, nikoli novou sérii testů pro ujištění.
Pak zobrazte celou zprávu:
sudo smartctl -a /dev/sda
sudo smartctl -a /dev/nvme0
Nejprve ověřte, zda model, sériové číslo a kapacita odpovídají cílovému disku. Poté zkontrolujte teplotu, provozní hodiny, protokol chyb a výsledky autotestu. Možnost -x poskytuje další podrobnosti, kdy -má nestačí:
sudo smartctl -x /dev/sda
Identifikujte metriky, které ovlivňují rozhodnutí
U disku SATA věnujte zvláštní pozornost Reallocated_Sector_Ct, Aktuální_čekající_sektor A Offline NeopravitelnéČekající nebo neopravitelné sektory, zejména pokud se jejich počet zvyšuje, vyžadují zálohování a přípravu k nahrazení. Stabilní počítadlo realokovaných sektorů automaticky neznamená selhání, ale měl by být monitorován.
Počet chyb UDMA_CRC_Error_Count To často ukazuje na připojení SATA: kabel, konektor, napájecí zdroj nebo řadič. Pokud toto počítadlo roste, zkontrolujte připojení a poté si znovu přečtěte zprávu. Nezaměňujte chybu přenosu s vadným sektorem.
Na NVMe SSD disku se podívejte Kritické varování, K dispozici Náhradní, Použité procento Chyby integrity médií a dat Použité procento představuje odhad spotřebované výdrže, nikoli přesný odpočet.
Názvy, prahové hodnoty a nezpracované hodnoty se liší v závislosti na výrobci. Vždy porovnávejte několik naměřených hodnot ze stejného disku. Kopírování nezpracované hodnoty z jiného modelu může snadno vést k chybné diagnóze.
Spusťte krátký test a poté si získejte jeho výsledek.
Pokud je disk stále přístupný a již nevrací chyby vstupu/výstupu, spusťte krátký autotest:
sudo smartctl -t short /dev/sda
smartctl označuje přibližný čas dokončení. Test se spustí na disku a příkaz okamžitě vrátí řízení. Nespouštějte ho však v obdobích velkého zatížení úložiště. Po uplynutí časového limitu zkontrolujte protokol:
sudo smartctl -l selftest /dev/sda
sudo smartctl -a /dev/sda
Výsledek by se měl jevit jako dokončený bez chyb. Přerušený test může být způsoben vypnutím systému, režimem spánku nebo jiným testovacím příkazem. Neúspěšný test v kombinaci s nestabilními sektory nebo chybami jádra posiluje rozhodnutí o výměně disku.
Dlouhý test s smartctl -t long Pokrývá větší oblast, ale trvá mnohem déle. Nepoužívejte to jako první akci na disku, který již selhává. V takovém případě obnovte všechna data, která jsou stále čitelná, než přidáte další hodiny aktivity.
Křížové odkazování na SMART s chybami jádra
SMART nenahrazuje protokoly Linuxu. Během aktuálního procesu spouštění hledejte chyby vazby, resety a chyby I/O:
sudo journalctl -k -b -p varování..alert --no-pager
sudo dmesg -T | grep -Ei 'ata|nvme|i/o error|reset|střední chyba'
Výukový program na dmesg a zprávy jádra Pomáhá rozlišit vadný pevný disk od nestabilního kabelu USB, řadiče nebo napájecího zdroje. Hodnota saturace naměřená pomocí nástroje iostat také není důkazem fyzického selhání: popisuje zátěž, nikoli stav paměťového média.
Před opravou souborového systému si zálohujte data
Pokud selže protokol SMART, zvýší se počet chyb médií nebo jádro hlásí chyby vstupu/výstupu, snižte počet zápisů a zálohujte důležitá data. Na vzdáleném serveru před restartem ověřte, zda je kopie použitelná.
Neházejte fsck otestovat zařízení. fsck Pracuje na konzistenci souborového systému a může značně zatěžovat již tak křehký hardware. Průvodce na fsck v Linuxu začíná záměrně identifikací, rozebráním a prohlídkou bez písemného projevu.
V případě NAS nebo serveru uchovávejte aktuální SMART reporty a sledujte jejich vývoj. Průvodce Také je dobré si uvědomit, že pole RAID nenahrazuje zálohu. Disk lze vyměnit, ale kopie dat nikoli.
Tam Manuální stránka smartctl dokumentuje možnosti, typy zařízení a autotesty. příklady z projektu smartmontools zobrazit hlavní zprávy SATA a NVMe. Dodržujte toto pořadí: identifikujte správný disk, přečtěte si celý stav, spusťte krátký test, pokud disk zůstane stabilní, a poté jej zálohujte nebo vyměňte, jakmile se signály sblíží.